目录

AI 热点日报:OpenAI 把 Harness 托管化,人形机器人量产驶入快车道

本期筛选 10 条高价值动态,其中 AI Coding 6 条、具身智能 4 条。核心观察:编码智能体正从「写功能」走向「守安全、管长任务、降成本」的运行时基础设施层;具身智能则密集出现「量产下线」「世界模型实时驱动」等真实落地信号,2026 被公认为规模化应用元年。

一、AI Coding 方向

1. OpenAI 发布 Agents API 公测:把 Codex Harness 作为托管服务开放

事件内容:9 月 10 日,OpenAI 推出 Agents API 公开测试版,将 Codex 背后的 Harness(持久会话、托管沙箱、子 Agent 协同、流式进度)打包为全托管服务,开发者无需自建编排层即可运行多小时的长时程编码 Agent。按普通模型/工具/容器费率计费,无额外 Agents 费用。

核心要点

  • 这是「Agent Harness 从开发框架升级为独立产品层」的标志性动作——卖的不是模型,而是承载长期任务的运行时基础设施。
  • 配合 GPT-6 Astra 与 Responses API 的异步工具调用、中途转向、推理强度切换、失配监控等原语,多步编码任务的工具调用与恢复能力被实质性强化。
  • 启示:评估 AI 编程工具时,应关注「增量规划 / 证据回传 / 验收分离」三能力,而非只看模型跑分。

2. Google 开源 Mantis:让编码智能体自动找漏洞、复现并打补丁

事件内容:Google 开源 Mantis 漏洞审查技能包(协议无关),可自动完成「发现缺陷 → 过滤误报 → 沙箱复现 → 写最小补丁 → 对补丁再攻击并给出 1-10 风险评分」的闭环。

核心要点

  • 将「安全左移」交给 Agent,是编码智能体从「写功能」迈向「守安全」的标志性开源项目。
  • 把安全审查从人工流程固化为可复用、可审计的技能包,对 CI/CD 与供应链安全有直接落地价值。

3. 清华 × Qwen 团队 Terminal-Universe:把 Agent 轨迹重构为可复用训练环境

事件内容:清华与 Qwen 团队提出 Terminal-Universe,从既有 Agent 轨迹还原可验证的代码工作区,自动生成海量新训练任务;微调 Qwen3.5-27B 后,Terminal-Bench 2.1 准确率由 46.2% 提升至 58.1%。

核心要点

  • 给出「轨迹即数据」的可复制范式:把线上运行产生的真实轨迹转化为训练信号,避免为编码模型专门构造数据的高成本。
  • 对自研编码模型、构建内部编码智能体训练闭环有较高参考价值。

4. GitHub HydraFusion:多模型编排,编码成本下降 36-67%

事件内容:9 月 4 日,GitHub 在 Copilot CLI 中推出 HydraFusion 研究预览,按任务动态编排多个模型——Single(单模型执行)、Cascade(廉价模型先试,质量不足再升级)、Critique(一写一审一改)。在 TerminalBench 2.1、DeepSWE、CheckpointBench 上达到与 Claude Opus 5 相当或更优的结果,而 token 成本估计降低 36-67%。

核心要点

  • 「智能组合多模型」成为降本主流路径,行业焦点从单模型跑分转向「编排策略 + 成本治理」。
  • 通过 /experimental 命令即可调用,无额外收费,降低了生产化尝试门槛。

5. Cursor 发布 Projects:协调跨周、跨子 Agent 的长期工作

事件内容:9 月 10 日,Cursor 推出 Projects——一个协调器 Agent,将大型工作(功能构建、迁移、新应用)拆解为子任务并行委派给子 Agent;共享上下文跨 Agent 同步,关闭笔记本后仍在云端运行,可订阅 Slack 频道、跟踪 PR、按日程执行。

核心要点

  • 编码 Agent 从「单次会话」走向「跨周持续运行」,叠加此前自托管机器(9/2)与 Start From Scratch(8/27),明确押注「更长、更少监督、更可控基础设施」的方向。
  • 长期 Agent 的交互界面正从聊天窗口演变为「任务收件箱 + 审批中心」(可暂停、可审批、跨设备恢复)。

6. Anthropic Claude Fable 5.1 与 Agent Plugins 标准

事件内容:Anthropic 推出 Claude Fable 5.1 / Mythos 5.1(面向长时程编码),并加入托管 Agent 权限策略(自动评估并允许/拒绝/暂停工具调用),生成产物可带 C2PA 内容凭证。与此同时,Agent Plugins(可复用组件扩展 Agent 的标准)获 OpenAI、Microsoft、Cursor、AWS 支持。

核心要点

  • 长时程 Agent 的「权限与审批设计」成为竞争焦点,自动拦截危险操作、人工在环暂停成为标配能力。
  • 插件标准化有利于生态互通,但 Google、Anthropic 暂未加入,标准阵营仍存分化。

二、具身智能方向

7. 小鹏 IRON 全球首台高阶通用人形机器人自动化总装并自主走下产线

事件内容:9 月 8 日,小鹏机器人自动化产线正式启用,全球首台高阶通用人形机器人 IRON 完成自动化总装并自主走下产线。IRON 全身 76 个自由度(单手 21 个),搭载 3 颗自研图灵 AI 芯片,有效算力 2250 TOPS,端侧部署物理 AI 大模型,核心制程自动化率超 80%。

核心要点

  • 标志着小鹏机器人从研发试制跨越到产线制造,迈向规模量产。
  • 「汽车级质量体系 + 高自动化率」为后续快速扩产奠定基础,是具身智能「量产元年」的硬证据。

8. 宇树 UnifoLM-X2-1.0:世界模型首次实时驱动全自主人形搏击

事件内容:9 月 7 日,宇树发布自研世界-动作大模型 UnifoLM-X2-1.0,首次实现人形机器人全自主搏击——出拳、格挡、躲闪及连续攻防转换全程未依赖遥控或预设脚本,由模型实时生成。

核心要点

  • 突破世界-动作模型在瞬时规划、决策与动态交互执行上的瓶颈,标志世界模型驱动在动态对抗场景迈入可用门槛。
  • 这是宇树 8 月登陆科创板(「人形机器人第一股」)后「大脑」层面的关键补强。

9. 智元 AGILE 2.0:灵犀 X2 实现行业首例自主踩球行走

事件内容:9 月 9 日,智元发布 AGILE 2.0 感控一体视觉端到端模型,整合环境感知、地形理解、全身运动控制与操作;搭载该模型的灵犀 X2 完成钻火圈、踩球行走、三人跳长绳等高难度任务,其中「踩球行走」为双足人形机器人首次自主实现。

核心要点

  • 从「预设脚本」走向「睁眼运动」,双足人形运动智能达到新高度,可适配动态扰动与多机协同。
  • 视觉端到端感控一体降低了对外置状态估计的依赖,利于真实场景泛化。

10. 京东开源 JoyAI-EchoWM:可交互视听世界模型,WBench Navigation 综合第一

事件内容:9 月 9 日 JDD 大会上,京东探索研究院发布并开源 JoyAI-EchoWM,原生联合生成 720P 视频 + 环境音 + 音乐 + 语音,支持第一/第三人称切换与多轮连续探索。在 WBench Navigation 158 案例中以 81.7 综合分位列第一(一致性 89.8、交互性 87.2),同步开源论文与权重。

核心要点

  • 为沉浸式内容创作与具身智能仿真训练提供新的世界模拟能力,可直接用作机器人训练的环境引擎。
  • 「视听可交互世界模型」与宇树、智元的运动智能形成互补——前者造环境,后者练动作。

三、趋势小结

  • AI Coding 收敛于「运行时基础设施」:Harness 正从脚手架独立为分层(Session/Context/Tool/Subagent/Memory/Eval/Policy 统一管理),竞争变量从「模型更强」转向「长期、可靠、可验证地跑下去」。
  • 具身智能进入「工程闭环跑通」阶段:技术竞争已从「模型能不能训出来」转向「世界模型 + 感控一体 + 量产产线」能否闭环,2026 下半年真实交付与下产线成为最强信号。
  • 共性关键词:长时程、可验证、降本(36-67%)、安全左移、插件/协议标准化。

数据来源:OpenAI 官方、MarkTechPost、GitHub、Cursor、Anthropic、清华/Qwen、小鹏汽车、宇树科技、智元机器人、京东探索研究院、央视网、科技日报等公开报道。