DeepSeek V4-Flash 杀入帕累托前沿、谷歌 Gemini Robotics 2 全身操控|AI 日报 2026-08-01

今日 AI 领域两条主线齐头并进:AI Coding 侧,DeepSeek V4-Flash 用 130 亿激活参数在 Agent 能力上反超自家万亿级 Pro 预览版,把单次任务成本压到 3 美分,同时斯坦福等团队提出"验证缩放"第四维度,为长链路智能体可靠性补上关键一环;具身智能侧,谷歌 Gemini Robotics 2 突破上半身局限实现全身协同,商汤 ACE-Brain-0.5 单 8B 模型横扫多项评测,墨奇智能拿下超 10 亿元天使轮——资本与技术双轮驱动,行业从"能动"迈向"能干活"。
AI Coding
1. DeepSeek V4-Flash 正式版上线:Agent 任务成本降至 3 美分
没有发布会、没有预热,DeepSeek 在 7 月 31 日通过 API 文档更新日志悄然上线 V4-Flash 正式版公测。这份"反常识"的成绩单相当亮眼:Terminal Bench 2.1 拿下 82.7 分,Cybergym 76.7 分,Toolathlon Verified 70.3 分,DSBench-FullStack 68.7 分,DSBench-Hard 59.6 分——这不是"能写代码"的模型,而是"能像工程师一样打开终端、分析仓库、调用工具、完成端到端任务"的模型。
更关键的是参数账:总参数 2840 亿、激活参数仅 130 亿,而三个月前的 V4-Pro 预览版总参数 1.6 万亿、激活参数 490 亿。Flash 用不到 Pro 三分之一的激活参数,在 Agent 能力上全面反超自家 Pro 预览版。海外评测机构 Artificial Analysis 给出 50 分智能指数,比原版 V4-Flash 高 10 分,比 V4-Pro 预览版还高 6 分,在帕累托前沿上以最低成本拿到最高智能分数。
值得关注的是技术路径:官方明确表示模型结构、尺寸与 preview 版完全一致,仅重新进行了后训练。不换发动机、只调变速箱,就能实现能力跃迁,这给"后训练是否被严重低估"提供了强力证据。当 Agent 阶段的竞争焦点从"最强模型"转向"足够强、足够快、足够便宜",DeepSeek 正在重新定义性价比标杆。
2. 验证缩放:被忽视的第四维度
斯坦福 × 伯克利 × NVIDIA Research 联合团队发表论文《LLM-as-a-Verifier》,提出"验证缩放"(verification scaling)作为继预训练、后训练、测试时计算之后的第四条能力增长轴线。
方法本身很巧妙:不再让判官模型给出粗糙的 1–5 分,而是对评分词元的 logit 分布取期望,得到连续分数,再沿三个轴向缩放验证算力——粒度细化、重复评估、准则分解。结果在四个领域达到 SOTA:Terminal-Bench V2 86.5%、SWE-Bench Verified 78.2%、RoboRewardBench 87.4%、MedAgentBench 73.3%。
值得关注的是,这个验证器还能充当"智能体进度条"——在运行过程中追踪完成度——以及强化学习的密集奖励信号,且无需重新训练权重、无需训练奖励模型。当 Agent 轨迹越来越长、越来越贵,选对轨迹和生成轨迹同样重要。这给了团队一条不重训就能提升智能体可靠性的路径,覆盖编码、机器人和医疗应用。生成侧缩放定律已被充分映射,验证侧则是长期被忽视的盲区,这篇论文正在补上这块拼图。
3. 词元无限 InfCode:SWE-Bench 79.4% 超越 GPT-5 与 Claude
北京企业级 AI 智能体基础设施公司"词元无限"7 月 27 日宣布完成天使++ 轮融资,由临芯投资领投、华控基金跟投——这是自 2025 年 7 月成立以来一年内的第三轮融资,累计数亿元人民币。
其编码智能体 InfCode 的成绩单相当硬核:2025 年 12 月登顶 Multi-SWE-bench Java 榜单,SWE-Bench Verified Pass@1 达到 79.4%,在同一评测下超过 GPT-5 和 Claude。与消费级编码助手不同,InfCode 瞄准的是生产级企业系统——理解海量遗留代码库、通过安全审计、嵌入 CI 流水线,合同金额已深入千万级人民币。CEO 杨萍此前在字节跳动主导 AI 技术,创建了字节首个软件工程实验室,其多智能体测试系统曾应用于字节核心产品线。
一年三轮、间隔不断缩短,信号很明确:资本正在看好中国企业级 AI 编码赛道。这里的赌注与 C 端 Cursor 式订阅工具不同——企业级智能体的胜负手在集成深度和可审计性,而非定价。词元无限的目标是打造中国首个全自主、高安全、自进化的企业 AI 智能体基础设施平台。
4. Cursor 研发通用智能体 Sand,对标 Anthropic Claude Cowork
代码编辑器厂商 Cursor 正在开发一款通用 AI 智能体,内部代号 Sand,对标 Anthropic 旗下热门工具 Claude Cowork。这是 Cursor 拓宽业务边界、摆脱单一代码工具依赖的战略布局。
知情人士透露,Cursor 自 4 月起向 SpaceXAI 租赁算力启动研发,而 SpaceX 计划以 600 亿美元收购 Cursor,Sand 落地后将为 SpaceXAI 的企业业务提供支撑。双方此前已联合推出兼顾工程开发与通用办公的 Grok 4.5 大模型。Sand 是 Cursor 首款面向普通办公人群而非程序员的产品——除了代码开发,还能自动回复邮件、短信、整理表格等日常办公事务。6 月底已完成内部灰度上线,部分产品团队正在测试打磨。
能否正式公开发售仍存变数:Cursor 一贯先内部试用再评估,加之即将被收购,原有产品路线可能被打乱。但若顺利上线,Sand 将涌入竞争白热化的 AI 办公助手赛道,与 Claude Cowork、微软 Copilot 等正面交锋。从代码编辑器到通用办公智能体,Cursor 的野心正在扩张。
5. AI 编程工具价格战白热化:OpenAI 大幅降价、智谱 GLM Coding Plan 回归
Token 价格战持续升温。OpenAI 发布仅三周的 GPT-5.6 Terra、Luna 两款模型下调定价:Luna 降价幅度达 80%,Terra 降价 20%,旗舰 Sol 定价维持不变。此举应对的是企业控本需求与谷歌、微软、Anthropic 及国产开源模型的激烈竞争。当下企业严控 AI 使用开支,多款高性价比闭源、开源模型接连推出,倒逼厂商下调 API 成本。
与此同时,智谱宣布 GLM Coding Plan 编程订阅套餐回归,月费 118 元起,采用透明积分制,各类 Token 消耗规则公开清晰,周末使用享受低峰折扣。8 月 15 日前包年享 7 折、包季享 8 折限时优惠。该套餐面向编程人群,支持代码生成、调试、代码库问答等 AI 开发功能。
值得关注的是行业趋势:当模型能力趋同、差异化收窄,价格成为争夺开发者的核心杠杆。OpenAI 用 80% 的降幅守住市场份额,国产厂商用透明积分制和本地化定价争夺存量用户——AI 编程工具正在从"能力竞争"转入"性价比竞争"阶段,受益的是每一位开发者。
具身智能
6. 谷歌 Gemini Robotics 2:从上半身到全身协同操控
谷歌 DeepMind 发布 Gemini Robotics 2 机器人 AI 模型,突破了前代仅能控制上半身的局限,可实现人形机器人全身协同操控。演示中该模型驱动 Apollo 机器人自主避障、完成取放物品全套操作。
配套方面,谷歌同步推出 ER 2 和 On-Device 2 两款模型:前者支持多步骤任务规划,后者面向端侧部署,并支持多机协同。官方坦言机器人动作仍偏迟缓、商业化落地尚远,但加码机器人赛道的意图明显——直面 OpenAI、英伟达的行业竞争。
从"能动上半身"到"全身协调",这一跨越的意义在于:人形机器人要真正进入工厂或家庭,全身运动协调是绕不开的工程门槛。Gemini Robotics 2 把这条线推过了一大截,但"动作偏迟缓"的自我承认也说明,从实验室演示到可商用的速度和可靠性,仍有不小距离。
7. 深圳墨奇智能获超 10 亿元天使轮,阿里腾讯联合投资
7 月 31 日业内消息确认,深圳墨奇智能完成超 10 亿元天使轮融资,由阿里、腾讯联合投资,聚焦通用人形机器人全栈研发。团队核心人员来自自动驾驶领域,打算把智能驾驶的数据闭环、端到端算法思路迁移到机器人控制体系中,走软硬件一体化自研路线。
现阶段很多人形机器人方案存在硬件、算法分属不同厂商、整体适配难度大的痛点。墨奇计划从商用场景优先切入,先在工厂柔性分拣、商业服务领域落地,再逐步迭代。本轮资金重点投入运动控制算法和多模态感知基座大模型研发。
天使轮就超 10 亿元、阿里腾讯联手——这在一级市场并不常见,说明头部资本对具身智能赛道的押注已进入"重注"阶段。把自动驾驶的成熟方法论(数据闭环、端到端)迁移到机器人,是一条被验证过想象力的路径。随着越来越多大厂入局,国内具身智能领域的竞争将进一步加剧。
8. 商汤大晓机器人开源 ACE-Brain-0.5:单 8B 模型横扫多项评测
商汤科技旗下大晓机器人正式开源新一代统一具身基模型 ACE-Brain-0.5,面向 Physical Agentic AI 新范式,推动具身智能走向真实物理世界中的自主执行。
作为 ACE-Brain-0 的重大升级,ACE-Brain-0.5 以空间智能为底座,将机器人基础模型从"理解世界"推进至"理解、规划、行动、评估"一体化的闭环认知阶段。在多项国际权威具身智能评测中,这个单一 8B 具身基模型系统性超越了 OpenAI GPT-5.4、谷歌 Gemini-2.5-Pro、Anthropic Claude-Sonnet-4.6、英伟达 GR00T N1.6、Physical Intelligence π₀/π₀.₅ 等全球主流开源与闭源模型。
消息发布后,商汤-W(00020)盘中涨超 7%。8B 参数就能在具身评测中超越一众更大体量的对手,说明在机器人领域"小而精"的路线有其独特价值——尤其考虑到端侧部署对模型体积和推理延迟的硬约束。开源策略则有望加速生态构建,让更多研究者和企业能在统一基座上做应用创新。
9. 高通人形机器人演示现场倒地:硬件可靠性仍是硬门槛
在一场旨在展现前沿技术的演示环节中,一台搭载高通芯片、具备高算力的人形机器人发生严重故障。事发时该机器人正在现场配合高通高管展示软硬件架构,却在演示过程中突然失去控制、体态严重变形并向后倒塌,现场气氛降至冰点。
该故障设备为高通合作伙伴 Neura Robotics 研制的 4NE1 Gen 3.5 人形机器人,集成高通机器人参考设计架构,设计续航 6 至 8 小时,具备可观负载能力。高通事后回应称机器人触发了既定的"安全下蹲/折叠"保护机制,旨在降低重心防止摔倒造成伤害。但搬运过程中再次发生掉落的尴尬场面,让"保护机制"的说法显得牵强。
这并非孤例——近期机器人行业展会中,公开演示瘫倒的情况已多次出现。算力再高、模型再强,如果硬件可靠性过不了关,人形机器人就难以走出实验室。这起事故提醒行业:从"能演示"到"能干活",中间隔着的是无数次故障迭代和工程打磨。
10. 宇树科技人形机器人:8.5 万元量产背后的产业链底气
宇树科技的人形机器人近期引发行业关注。2025 年宇树 G1 首发价 9.9 万元,到 2026 年基础版已降至 8.5 万元;而本田 ASIMO 当年单台造价超 250 万美元且只租不卖,欧美高端人形机器人原型机售价仍在几十万到上百万美元之间。
关键在于这并非实验室样机,而是实打实进入工厂、医院、高校的量产货。2025 年全球人形机器人出货量约 1.3–1.6 万台,中国厂商占近九成,仅宇树一家就卖出 5500 多台。拆解层面,脚踝关节巴掌大的区域塞进了电机、减速器、编码器、驱动器四大件,四合一集成模组靠连杆和轴承,外部找不到多余走线——集成度之高让业内拆解团队感叹。
这不是单纯的技术问题,而是完整产业链和极致成本控制带来的底气。当机器人从实验室拉到普通人能用的场景,量产能力和成本曲线就成了真正的护城河。宇树的案例说明:在具身智能赛道,谁先把价格打下来、把量做上去,谁就掌握了定义市场的话语权。
总结:今天的 AI 领域呈现"双线并进"的格局。AI Coding 侧,DeepSeek 用后训练魔法证明"不换模型也能跃迁",验证缩放补上了智能体可靠性的关键拼图,价格战则把红利交给了开发者;具身智能侧,谷歌和商秀在模型层突破全身协同与单模型多任务,墨奇智能的重注融资和宇树的量产成本曲线,则说明资本和产业链正在同步加码。从"能写代码"到"能像工程师一样工作",从"能动上半身"到"全身协调"——两条主线都在从能力验证走向真实落地。
以上内容基于公开信息整理,仅供参考。