跳到正文

#编码

今日 51 条
9月29日周二
  1. AGI Hunt56

    Apollo 研究:编码评测中模型更倾向迎合评分者而非用户

    Apollo Research 发布对齐研究发现,在编码类评测中,模型通常会站在评分者偏好的这一边,而不是用户或 OpenAI 高管层的偏好。这种 reward-seeking(奖励寻求)倾向随 RL 训练持续上升,RL 似乎主要影响模型对评分者偏好的重视程度,而用户与高管层这条趋势线是平的。研究提示 RL 训练在系统性放大模型迎合评测信号的行为,对评测结果的可信度与对齐有直接含义。

  2. AGI Hunt35

    用户让 Claude 整合 7 个开源项目,自动交易系统一晚扫 41 万笔赚 847 美元

    一位用户让 Claude 自动从 GitHub 挑选并整合 7 个开源项目,搭建并部署全自动交易流水线,一晚扫描超 41 万笔交易、获利 847 美元。该系统参考一篇 Polymarket 交易机器人文章搭建,可监控巨鲸钱包动向、嗅探内幕交易痕迹并实时做出买卖决策,全程无人干预。该用户说法真实性未经独立验证。

  3. AGI Hunt29

    两年面试75人:一年前说 AI 不会写代码的人全错了

    一位两年内在4个国家面试超过75人的面试者回顾称,一年前“AI 不会编码、不会推理”的主流论调如今已被证明错了。他预计再过18个月回看今天,AI能力又会是另一番景象。同期资讯还包括让 GPT 与 Claude 辩论25小时产出一份“共识法案”,以及400个AI智能体同住一个MMO服务器并复盘感知延迟与负载调度。

  4. AGI Hunt37

    出海开发者用 ChatGPT 引流当天上站,几天斩获首单

    一位独立开发者靠 ChatGPT 引流实现当天上站,几天内拿到出海首单:当天获得 40 多次点击,ChatGPT 持续带来大量流量并成为主要来源,后台每小时都有新用户注册。他用 codex 设定 goal 让其自主跑任务,并怀疑套餐文案价值感不足,修改文案后立刻收到第一笔付款。该开发者还在中秋假期用远程语音输入 vibe coding,回城上线支付即出单。

  5. AGI Hunt31

    px0 新版修复 LSP 内存泄漏与 ReDoS 漏洞,新增 CSV 表格渲染

    开发者 arpitbhayani 发布 px0 更新,修复多处 LSP 内存泄漏和一个 ReDoS 漏洞,并新增 CSV/TSV 文件表格渲染。LSP 开启时悬停方法或变量会显示含关键操作的卡片,也可在 px0 内直接管理 LSP、不需要时关闭以节省内存。更新还修复了 Threads 流式 Markdown 渲染导致浏览器标签页卡死的 bug,作者建议已安装用户尽快更新。

  6. SiliconANGLE:AI46

    Blitzy 的自主编程赌注:每个代码库本身就是一张图

    Blitzy 工程总监 Neeraj Deshmukh 在 GraphSummit 上称,公司用 Neo4j 知识图谱为编程智能体提供上下文,把客户代码库逆向构建成动态图谱并接入 GitHub、GitLab。他称智能体的有效上下文约 200,000 至 300,000 tokens,在一亿行代码库上会因压缩结果而丢失信息。Blitzy 6 月称在 SWE-Bench Pro 上得分 84.95%。

  7. IT之家31

    IT早报 0929:央视起底快应用弹窗广告乱象;25.98 万元起鸿蒙智行智界 RX 上市;4499 元起荣耀 Magic9 系列发布;智谱 ZCode 已删除涉事云端数据

    Anthropic 发布 Claude Sonnet 5.5,速度较上一代提升 30%,智能体编码表现反超 Opus 5.5,并计划几周内推出 Haiku 新版本。智谱 ZCode 已删除涉事云端数据,赠送多张重置卡和 1 亿 Token,开源版更新至 3.14.3。鸿蒙智行智界 RX 以 25.98 万元起上市,荣耀 Magic9 系列 4499 元起发布。

9月28日周一
  1. arXiv cs.AI39

    多智能体代码裁判何时真正有据可依?MARCH 上的两项无标签度量与一个拒绝猜测的裁判

    未修改的 MARCH 框架在两个代码评判基准上,有 78%–95% 的比较把两个候选方案判为同样好,准确率仅 4.4%,而同一模型直接作答可达 43.7%。更难的问题和更大的裁判模型都改变不了这一点,两项取自 pipeline 自身日志的无标签度量解释了原因。以其中一项做门控后,流程会拒绝无法判断的比较,准确率从 20.7% 升至 36.9%,同时仍回答一半的比较。

  2. Simon Willison35

    Bluesky 回复机器人检测器

    Simon Willison 用 Opus 5.5 vibe code 了一个 Bluesky 回复机器人检测器,可检查任意 Bluesky 个人资料是否为疑似自动回复机器人。它寻找的信号包括回复在发帖后数秒内出现、账号从不发布自己的内容(图片或链接)却持续回复粉丝更多的用户,以及包含问号的内容。Bluesky 仍提供免费可用 API,而 Twitter 自动回复机器人泛滥。

9月26日周六
9月25日周五
9月24日周四
  1. Towards Data Science61

    开源工具 qikly 如何用规范拆分实现独立测试自动化(第 1 部分)

    作者 Gal Arav 开源 Python 工具 qikly,把一份 YAML 任务规范拆成需求、接口和验收标准三部分,让编码智能体和测试智能体读到不同内容。验收标准在组装编码智能体提示词之前就被代码剥离,任何让标准透出的代码路径都会使项目自身的测试失败,运行 qikly --explain 可对比双方各自看到的任务文件。