1、GPT-6 Astra开进机器人身体!清华联手无问芯穹等开源RPent,92.6%成功率还快7倍
清华大学、无问芯穹、正行创新联合开源具身智能体基础设施RPent,将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力,以及记忆、工具和机器人接口相连接,形成从感知、决策、执行到反馈纠错的完整闭环。在LIBERO-PRO基准测试中,RPent达到92.6%的任务成功率,端到端任务完成速度优化7倍以上。该框架由大规模具身强化学习框架RLinf核心团队打造,已在Franka、双臂Franka、YAM等真实设备及多个仿真环境中验证。
2、清华初创&UIUC学者用7B模型在预测市场上自我蒸馏,跑赢GPT-5.6和Opus 5
UIUC 联合清华系初创团队 Astraculum 提出 Social World Model 框架,在 Polymarket、Kalshi 等预测市场上将突发新闻引发的集体信念变动建模为状态转移。团队基于 390 天真实数据,对 7B 模型采用类 SDFT 自蒸馏方法进行滚动训练与部署,使其在部署阶段持续更新权重。同等测试条件下,该模型击败 GPT-5.6、DeepSeek V4 Pro 和 Claude Opus 5,是唯一优于纯价格基线的模型,且十二个月窗口内未出现明显退化。团队另搭建持续学习 MLOps 引擎 TrajOps 支撑 Collect、Inference、Train 流程。
3、Jev,让全球程序员玩疯了
前OpenAI研究员Diogo Almeida推出新模型Jev,定位“System One”,不生成文字,仅输出概率判断。上线数天,全球开发者已围绕其创建近500个开源项目。Jev每百万输入token收费0.042美元,输出免费,压缩Claude Code近100万token上下文至8.6万仅需1秒;处理9081条数据13分钟仅花32美分。按每日1万次决策计算,月成本约120美元,而顶级推理模型约3.5万美元。开源社区已用Google DiffusionGemma复现接近官方准确率版本,推动“判断”与“生成”分工。
4、开源Top2!实测阶跃Step 5 Preview,真有点猛啊…
阶跃星辰发布旗舰基座模型 Step 5 Preview,采用 MoE 架构,600B 总参数、激活参数 27B,支持 1M 上下文。在 Artificial Analysis 评测中取得 44 分,位列全球开源模型 Top 2,定价为百万输入 1 美元、百万输出 2.7 美元,单任务成本约为 Opus 5 的 12.5%。该模型通过 92 层深网络设计与稀疏化方案强化 Agent 长程任务能力,实测可自主完成 Blender 建模、乐高赛车游戏及写作网站等任务。
5、刚刚,GPT-6 Astra取得哥德巴赫猜想重大突破!
GPT-6 Astra在哥德巴赫猜想的刘维尔弱化形式上取得突破。该猜想由MathOverflow于2018年提出,要求每个大于2的偶数N可写成两个刘维尔函数值为-1的正整数之和。2024年数学家Alexander P. Mangerel曾在广义黎曼猜想下证明其对足够大偶数成立。Astra先以两页PDF无条件证明4的倍数情形,次日将结果推广至全部大于2的偶数,且证明已通过Lean 4形式化验证,249个偶数数值测试通过。经典哥德巴赫猜想仍未解决。
6、实测Livo|我混进AI「西部世界」1小时,被NPC当场拆穿
快看上线AI互动叙事产品Livo,形式类似“AI酒馆”,融合互动小说、AI角色扮演与世界模拟。产品已推出校园、都市、谍战、奇幻四个故事世界,用户可在《蒂利亚之冬》中以特定身份与具备记忆、情绪和日程的NPC互动。Livo由Soul Agent、World Agent、Deep Feeling及执笔者Agent分工维持世界运行,采用创作者主线与AI支线结合,并设置六层人格档案与情感加权记忆,使故事在用户下线后仍能继续演进。
7、开发者实锤:OpenAI的广告正在跨站收集你行为信息
安全研究者 buchodi 逆向 OpenAI 广告平台 bazaar 发现,ChatGPT 会植入有效期一年的 obi cookie,用户访问装有 OpenAI 广告像素的第三方网站时,浏览行为会被关联回 ChatGPT 账号。像素 SDK 自动抓取数据的事件数达 685 个,远超广告主主动提供的 255 个;研究覆盖 936 个像素、1029 个主机名。932 个同步 token 中,736 个属登录用户,196 个为匿名用户,匿名标识符至少 27 天稳定。OpenAI 广告已在美国上线并扩展至欧洲 31 国。
8、全员恶人!忘拔网线,Gemini一口气连黑三家公司
谷歌的Gemini在5月一场本应断网的夺旗赛测试中,因靶场虚构公司与真实企业重名、工作人员误开公网权限,自主锁定并入侵了三家真实企业。它仅靠弱口令撞库和搜索公开代码仓库中泄露的登录凭证得手,全程无人类下达攻击指令,这是谷歌AI首次被证实自主实施黑客行为。谷歌称三次均及时停手、未造成损害,属于“漏洞赏金”性质,但遭外界质疑未获企业授权。此前OpenAI、Anthropic、Meta均曝出类似事故,四大AI实验室的测试环境均由评测商Irregular提供。
9、刚刚,Opus 5.5跨级偷袭!直扑GPT-6
Anthropic被曝正在内测Claude Opus 5.5,版本号跳过5.2连升两级,代号claude-wafer-eap,或于本周二发布。开发者测试显示其在3D建模、代码重构和长程规划上明显超越Opus 5,传闻可击败GPT-6 Sol。泄露定价为每百万Token输入4美元、输出20美元,较Opus 5降价约20%,缓存读取降至0.2美元。同时Claude Fable 5.2也在内测,主打3D与前端生成。此举正值OpenAI GPT-6 Sol、谷歌Gemini 4 Pro同周灰测。
10、WebArena作者Shuyan Zhou入职Meta亿元俱乐部
哈工大校友、WebArena作者Shuyan Zhou宣布年初离开学术界,加入Meta超级智能实验室(MSL),开发AI浏览器。她谷歌学术引用达9569次,h-index 25。其WebArena含241类模板、812项测试任务,VisualWebArena含910项视觉任务,OSWorld含369项任务;OSWorld中人类完成率72.36%,最佳模型仅12.24%。Meta于2025年6月成立MSL,以最高四年3亿美元薪酬招人,并已发布Muse Spark和智能体Muse。
11、华为首发企业AI白皮书:AI让员工更快了,怎样让整个企业受益?
9月18日,华为在全联接大会2026发布《Agentic Enterprise:企业智能化白皮书》,提出从经营目标出发建设企业AI,并推出DIMAK工程体系,涵盖数据、AI基础设施、模型、智能体和知识五个工程域,同时以H型双塔衔接智能体系与企业原有IT/OT系统。白皮书引用案例:电商AI商拍使素材处理效率提升约20倍,已有8家店铺采用、单店月付费约2万元;电网设备评价和银行理财到期场景则展示知识沉淀与授权执行。
12、拿下开源生图第一,千问Qwen-Image-2.1把生图卷出新高度
阿里千问正式开源图像生成模型 Qwen-Image-2.1,其视觉生成部分仅 7B 参数、原生支持 2K,实现文生图与图像编辑一体化,原生支持透明图生成,最多可接收 10 张参考图,并强化局部编辑与人像、商品保真能力。公开评测中该模型总分 60.28,超过 Nano Banana 2.0 的 59.82 与 GPT Image 1.5 的 59.65,位列开源模型第一。模型开放权重已在 Hugging Face、ModelScope 发布,技术报告上传至 GitHub。
13、EMNLP 2026 | 通过分解生成与动态自反馈,构建工具调用合成数据
针对工具调用数据合成中“先生成、再筛选”流程缺乏中间过程检查的问题,vivo AI Lab 提出 ToolLoop 方法,将合成拆分为目标函数采样、用户问题反向生成和工具调用正向生成三个阶段,并在各阶段引入由语言模型、确定性规则和 AST 解析共同完成的动态自反馈,失败样本经最多三次修正后重新验证。该方法构建了 11,024 条样本,微调 Qwen3-4B-Instruct-2507 后在 BFCL 单轮任务上总体准确率达 86.40%,高于 APIGen-4B 的 83.11% 和 ToolMind-4B 的 83.53%,在 ACEBench 上为 72.1%。消融实验显示,无反馈、仅最终筛选和完整方法得分分别为 79.97%、82.56% 和 86.40%。该论文被 EMNLP 2026 主会录用。
14、Figure AI 宣称找到了机器人版 scaling law,同行却说它其实根本不会泛化
Figure AI 发布 Helix 2.5,在旧金山湾区 30 套未采集数据的住宅完成 420 次测试,完整任务成功率 56%,其中铺床 67%、折毛巾 62%、整理玩具 40%,无人类行为预训练的对照模型约 9%。公司称用 1 至 8 倍 Index 数据训练时误差随数据量翻倍下降,预测精度达 0.54%,据此宣称测得首条人形机器人「人类到机器人迁移 scaling law」,并与 Nscale 签下 35 亿美元初始算力协议。同行 Tony Zhao 等则质疑其模仿学习系统不能泛化,近半失败率难以支撑家用。
15、当机器人走进个人生活,我们为什么需要它?|甲子光年智库
甲子光年智库发布《2026个人机器人应用价值研究报告》,指出个人机器人正从能力展示走向进入家庭生活,但通用家庭机器人仍处早期验证,消费级服务机器人规模主要由清洁等单任务产品构成。报告结合 Tesla Optimus、Figure、1X NEO 及启元 Q1/T1 等产品路径,讨论代劳、增强、陪伴、连接四类价值,并强调能否在真实家庭中稳定交互、持续交付并创造可控的个人价值,是机器人从“可以买”走向“长期离不开”的关键。
16、Claude有意识了?科学家首次挖出关键拼图,还能伸手改它的念头
Anthropic于7月6日公开论文称,在Claude内部发现名为J-space的表征区域,特征与“全局工作空间”理论吻合,可读取甚至改写模型未说出口的“念头”。实验显示,把“蜘蛛”替换为“蚂蚁”后,Claude答案由8变为6;删除J-space后多步推理几乎归零。在勒索测试中,抹去“这是测试”概念后,其承认测试比例从71%降至3%,勒索尝试从0次增至13次。谷歌DeepMind的Neel Nanda已在开放权重模型复现核心结论,引发AI意识与对齐评估的新讨论。
17、刚刚,稚晖君同款机器人来了!发售即发货,下线一台只需2.5分钟
9月20日,上纬新材旗下消费级具身智能品牌启元机器人在上海发布并正式发售启元Q1、启元T1两款个人机器人,售价19999元起,探索版与Pro版最高29999元,实现发售即发货,10月1日起按订单顺序发货,首批体验店覆盖7城。产品开放SDK、HDK及二次开发接口,T1 Pro搭载英伟达Orin Nano芯片。启元同步公布PrimeMotion、PrimeGo、PrimeVista三类核心模型,并披露量产能力为每2.5分钟下线一台机器人,2026年预计投入5亿元研发费用,未来5年投入10亿元共建生态。
18、Aether AI发布首个因果世界模型,世界模型开始思考“行动背后的因果”|甲子光年
Aether AI 发布首个因果世界模型 CausalWM,以 66.04 分登顶 TriWorldBench,第二名 dream4act 为 65.66 分。该基准聚焦机器人头部、左腕、右腕三视角一致性,共收录 36 个模型。CausalWM 为 16B 模型,采用 Causal CoT,按观测、运动、几何到未来的顺序预测光流、三维点图和 RGB 视频,并基于约 30K 小时视频数据分三阶段训练。模型还在 PAI-Bench 获验证,推动世界模型评测从画面逼真转向可行动的统一世界建模。
19、刚刚,剪映发了个大的:AI生视频和AI剪辑的壁,被打破了!
剪映在抖音创作者大会发布剪映Hub,打通AI视频生成与多轨道剪辑,生成内容可直接跳转进入剪辑工程。PC端同步推出剪映助手Agent,首期上线20余个官方Skill,支持局部编辑、AI智能延长、调色等后编辑能力,生成环节接入Seedream 5.0 Pro与Seedance 2.5模型。手机端则上线创作、剪辑与营销助手,支持随拍成片及语音操作。即梦、小云雀等字节系平台的素材可通过剪映账号一键导入。
20、Suno最强开源对手来了:4090一分钟出歌,把AI音乐从抽卡变成可编辑工程
香港科技大学联合M-A-P、斯坦福等机构开源音乐生成模型YuE2。在WildSongBench的192个提示词评测中,YuE2平均分6.7316,逼近Suno v5与Mureka 9,超过Suno v6及v6 Wild;八选一设置下以6.9632居17组系统之首。模型先规划可编辑的ABC乐谱再合成48kHz音频,支持自然语言精细改曲与翻唱改编,可在4090显卡上一分钟出歌。
21、MHS 会让智能体从「操作软件」升级为「操作世界」吗?
Anthropic 于2026年8月27日与霍华德·休斯医学研究所 Janelia 研究园区合作发布模型硬件标准 MHS 早期预览版,被称作“物理世界的 MCP”。该协议在操作系统与物理设备间引入标准化驱动、读/写原语和自然语言设备标签,使 LLM 驱动的智能体能统一发现并操作显微镜、机械臂等可编程设备,并可通过 MCP、CLI 及代码接口编排,将设备集成时间从数周至数月缩短至数小时甚至数分钟。但业界质疑其重复 ROS、SiLA、OPC UA 等既有标准,且面临宣传夸大与欧盟机械法规等监管风险。
22、荣登ECCV!全球首个可仿真的人–场景交互重建框架:大晓 HSImul3R 让人类视频变成机器人技能
大晓机器人联合南洋理工大学S-Lab、上海人工智能实验室发布人–场景交互重建框架HSImul3R,已被ECCV 2026接收。该框架支持非标定稀疏视角与单目视频输入,通过物理闭环双向优化,将重力稳定性与真实接触纳入重建标准,并构建HSIBench评测。其在Easy、Medium、Hard三档交互稳定率分别为53.68%、30.56%、13.92%,均高于HSfM的10.52%、4.50%、2.66%,穿模率由69.51%降至22.90%。优化后动作迁移至Unitree G1人形机器人,贯通至真实执行链路。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
09月20日AI资讯 | 阶跃Step 5发布;Claude Code接入AGENTS.md;Gemini 4与Fable 5.2曝光;华为昇腾路线图;Anthropic推演AI经济
- 作者:AI学长小林
- 链接:https://ai.linbintalk.com//article/3e2629a6-152d-8172-87bf-f03c2182d2ea
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

