1、Aether AI发布CRIS-0:因果智能交出第一份物理世界答卷|甲子光年
Aether AI发布CRIS-0,将因果智能接入真机闭环。该模型以统一因果状态表示打通因果智能体与因果世界模型CausalWM,通过统一工具接口调度自由空间运动与接触密集型操作,并在家庭场景完成咖啡制作、微波炉加热、垃圾分拣等任务。实测中,面对物体移位等扰动,系统平均2秒内重置规划,10次强干扰测试成功恢复9次;防碰撞场景平均0.2秒触发制动,急停响应可达0.1秒级。此前CausalWM曾登顶TriWorldBench。
2、清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据
清华持股的具身公司星动纪元自研世界动作模型VPP2登顶RoboDojo仿真榜单,综合平均成功率32.26%、平均得分39.26分,均列第一,超越GPT-6-Astra、英伟达GR00T-N1.7等,并在泛化、精细操作、记忆三维度居首。VPP2未用额外数据或增强手段,仅靠标准数据集。真机ALOHA零样本10类任务平均成功率58.5%,高于π0.5的40%,9类最佳;14B版本指令遵循成功率90%,超过64B Cosmos3的78%。
3、不等Gemini 4了!谷歌发布办公Agent,支持调用Claude
Google Cloud 发布办公智能体 Gemini Agent,由 CEO Thomas Kurian 署名介绍。该 Agent 可自主规划任务、跨应用调用工具并支持多 Agent 协作,企业能为其创建独立邮箱、日历与账号,使其像同事一样参与协作。它具备会话、语义、程序性、情景四类记忆,底层模型可在 Gemini 系列与 Anthropic 的 Claude 系列间动态选择,并支持 Smart Routing 自动路由与多模型编排。此举紧随 OpenAI 于 9 月 29 日发布 7×24 小时运行的 Dots,以及 Meta 推出的个人 Agent Muse。
4、刚刚,GPT-6.1 Sol Ultrafast 来了!
OpenAI 推出 GPT-6.1 Sol 的 Ultrafast 版本,速度达标准版 8 倍,智能水平仍接近旗舰 Astra。定价上,标准版 API 为每百万输入 token 2 美元、输出 10 美元,Ultrafast 为输入 12 美元、输出 60 美元,是标准版的 6 倍。该模式在 Codex 和 ChatGPT Work 端仅向月费 500 美元的 Pro 500 及符合条件的 Enterprise、Edu 用户开放,引发用户不满;API 端不受订阅限制,可按量付费调用。
5、价格暴降90%,多项测试超GPT-6 Luna!Anthropic最便宜模型来了
10月7日,Anthropic 发布迄今最便宜的小模型 Claude Haiku 5.5,10万 Token 以内请求的输入输出单价较上代下降90%,每百万输入 Token 最低0.1美元。官方测试显示,其在 OSWorld 2.1 计算机操作任务中成功率达72.4%,超过 OpenAI GPT-6 Luna 的48.9%;Terminal-Bench 4.0 得分39.2%,同样领先。该模型首次引入可调推理强度,支持100万 Token 上下文。Anthropic 同时将 Sonnet 5.5 缓存读取费下调50%,15天内完成 Claude 5.5 系列全部更新。
6、微软给Agent立规矩,Windows要管AI了
北京时间10月8日,微软在Windows 11正式开放AI Agent执行隔离工具MXC,允许企业限制Agent访问文件、网络等资源。OpenAI Codex、GitHub Copilot、英伟达OpenShell等已支持,Claude Code、Manus、Perplexity计划接入,Meta Muse将推出集成MXC的Windows原生应用。微软强调隔离、身份与可管理性;Anthropic披露Claude Code用户约批准93%权限请求,显示仅靠用户确认难以有效控权。
7、字节找到了DeepSeek时强时弱的原因
字节跳动Seed团队发现,DeepSeek-V4系列模型存在"相位敏感性":同一问题仅在输入前添加少量无关字符,答案便会随填充长度以4个Token为周期反复变化。在128K长上下文"大海捞针"测试中,同一信息仅改变位置,DeepSeek-V4-Flash-Base准确率最大差距达40.2个百分点,Pro-Base为34.8个百分点。研究将原因指向分块KV Cache压缩,其压缩步长与波动周期一致。经后训练,Flash-0731差距降至19.1个百分点,V4.1-Flash-0910降至6.1个百分点,但周期性仍存在。
8、AI写代码省的时间,全赔在调试上?Claude官方:让AI自己测、自己改
9月28日,Anthropic发布Claude Code调优指南,针对AI应用反复人工调试的痛点,推出两个入口:/claude-api build-eval 可将具体需求转化为可反复运行的评估题库,/claude-api hillclimb 则让Claude逐轮提出修改并复测,改善才保留、退步即撤回,并要求Claude Code v2.1.259及以上。官方内部客服案例显示,在14张留出测试工单上,决策准确率从78.6%升至90.5%,模型调用成本降至约原来的1/5。流程另设不公开的验收考题以识别过拟合,改差则回退。
9、李飞飞团队造了个世界动作模型:换个底座,机器人成功率直接飙升
斯坦福大学李飞飞、吴佳俊团队发布开放世界动作模型框架OpenWAM,用于统一评测世界动作模型设计。该框架基于阿里Wan2.2-5B,在334万条、约1.46万小时交互视频上预训练,采用5B视频与2B动作专家的共享MoT架构。实验中,VTA在LIBERO平均成功率达98.6%,真机Franka FR3为92.1%;因果化底座使LIBERO-Long成功率从68.4%升至97.8%,反事实数据训练的局部IDM迁移成功率达84.0%。代码与权重已开源。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
10月08日AI资讯 | GPT-6全面开放上线智能UI;Claude Haiku 5.5降价九成;华为披露AI芯片牌局;Mistral发布万亿参数模型;Manus融资5亿美元
- 作者:AI学长小林
- 链接:https://ai.linbintalk.com//article/3f4629a6-152d-8102-9112-c83dcc3337cb
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

