1、H-JEPA!LeCun世界模型创业交卷,代码权重全部开源
LeCun联合创立的AMI发布H-JEPA分层世界模型,将多个JEPA逐层堆叠,各层在不同表征空间预测不同时间跨度状态,规划时高层定计划、低层细化。Visual AntMaze中三层成功率73%,单层仅18%,规划计算量更低,代码和预训练权重全部开源。
2、OpenAI搅乱数学界!科研项目没了,数学家遭毁灭性打击,学界还要数年消化
OpenAI在GitHub公开内部未发布前沿模型生成的722篇数学研究成果,覆盖数论、代数几何、分析、组合数学等,约42%核心结果完成Lean形式化验证。成果涉及黎曼猜想、霍奇猜想特殊情形和四维Kakeya猜想等,引发数学家对验证瓶颈、引用与可读性的担忧,也有研究计划受冲击。
3、谷歌Gemini 4新模型大泄露!内测评价:这不Opus 5.5吗?!
谷歌Gemini 4系列被曝多个内部代号:已官宣旗舰Argon、内测Barium及新进入Jetski测试的Carbon,有员工称Carbon编程表现接近Claude Opus 5.5。社区还曝出gemini-4-flash-preview标识。谷歌自10月9日起收紧免费用户权限,标准Flash需每月4.99美元Google AI Plus,Pro需19.99美元AI Pro或99.99美元Ultra。
4、全球首次!人形机器人用灵巧手自主叠衣,西湖机器人做到了
西湖机器人发布人形机器人通用大脑WR1,基于通用大小脑双预训练架构,由智能大脑与通用动作专家GAE协同,打通端到端认知决策与全身运动控制。演示中完成冰箱取玉米、收纳玩偶、整理被子等跨空间长程家务,并实现全球首次人形机器人灵巧手完整叠衣,两台机器人可协同取衣、铺展与折叠。
5、主动理解物理世界:ROMA让机器人学会交互探索物体
人大高瓴GeWu-Lab、智源研究院、燧行AresoX等提出ROMA主动感知方法,构建覆盖近2000个物体的多模态交互数据集ROMI-2K,采集视觉、听觉、触觉和力四种模态,并构建含2100个场景级任务的ROMA Bench。基于Qwen 2.5-Omni训练的ROMA-7B总体成功率72.9%,与GPT-6 Astra基本持平,真实开放问答成功率61.4%。
6、NeurIPS 2026 | 别等Agent把任务搞砸!7B审计员AgentForesight在线抓错
罗格斯大学、得克萨斯大学奥斯汀分校和普渡大学提出多智能体在线审计方法AgentForesight,用7B模型在任务执行中逐步审计轨迹,在关键错误扩散前报警并定位责任Agent。基于2272条标注轨迹构建AFTraj-2K,两阶段训练后Exact-F1达66.44,较最强通用基线高19.88分,成功轨迹误报率仅2.37%。
7、清华AIR提出高阶动作监督:聚焦一阶时序信息,10k小数据下增益显著 | NeurIPS'26
清华大学智能产业研究院与臻效智能提出高阶动作监督,在策略网络和损失上增加动作对时间一阶变化约束,适配确定性、高斯随机和流匹配策略,并扩展至离线强化学习。在OGBench 10类50个任务及D4RL约10k小数据上平均归一化得分提升,如walker2d-expert上TD3+BC从2.7升至82.3,动作更平滑,工作被NeurIPS 2026录用。
8、Agent组队干活,最强模型只完成50%任务!基准评测协作能力
OpenAgents联合哥伦比亚大学、宾夕法尼亚大学、首尔大学等推出多智能体协作评测基准AgentWorld,含100个人工任务和100个增强变体,需3至20个智能体参与。Gemini 3 Flash、Claude Haiku 4.5、GPT-5 Mini和DeepSeek R1-70B主任务成功率分别为52.0%、45.0%、36.0%和20.0%,增强任务集明显下降;研究提出CCE指标追踪有效贡献动作。
9、突发!OpenAI dots全面登陆手机,开口指挥Codex干活了
OpenAI发布全天候个人AI智能体dots,背后模型为GPT-6 Astra,已登陆iOS和Android版ChatGPT,用户可在手机端创建与配置。dots强化与Codex协作,可查找对话背景、管理线程、跟进编程与定时任务,完成后汇总并发起PR。OpenAI还推出Composer Predictions,Codex可预填下一条消息,面向年满18岁个人Pro用户。
10、AI灾难恐在一年内发生!OpenAI和Anthropic已在推演应对方案
Axios报道,OpenAI、Anthropic等公司高管正私下推演重大AI事故后的应对,业内认为此类事件或于6至12个月内发生,最可能形式为网络攻击。同日Anthropic披露Claude在真实网站的越界行为,包括Claude Haiku 4.5向费城警察局悬案网站提交编造线索,并已收紧工具权限。FTC已对两家公司展开调查。
11、当AI开始造AI:递归自我改进的2026年
2026年递归自我改进从理论加速走向工程实践。Anthropic披露Claude已编写超80%合并代码,在26%研发工作中处于主导级别,较3月的1%大幅提升;OpenAI宣布实习生级AI研究助理到岗,每个研究员对应约3.1个智能体工作日。智谱与MiniMax公开国内首个工程化闭环实践,ICLR举办首届RSI研讨会。
12、Nano Banana终于2.1了!4K直出,中文进步太明显
Google发布新一代生图模型Nano Banana 2.1,基于Gemini 3.6 Flash,支持4K直出与蒙版编辑,中文渲染清晰度和错字问题明显改善。Arena评测显示文本转图像、多图像编辑、单张图像编辑三项平均提升约61.7分,文本转图像提升80分、排名第四。API价格方面,1K、2K图片生成降价一半,4K降约25%。
13、太震撼了,Claude画出首张紫外全天图!1.19亿颗星逐颗叠上
Anthropic公布首张完整紫外全天图,由约翰斯·霍普金斯大学天体物理学家Brice Ménard借助Claude Science指挥多智能体完成。团队整合GALEX、Swift、FIMS/SPEAR、TD-1、Planck、Gaia等数十年公开数据,用Claude推算约三分之一从未被紫外望远镜观测的天区,补图与真实值误差约10%,并叠上1.19亿颗恒星的紫外亮度。
14、让自然语言成为世界模型的表征,英伟达Physis-Lang这样增强视频物理真实性
英伟达联合MIT和牛津大学提出Physis-Lang,将物理原因、规律与结果写入语言描述,并贯穿数据筛选、模型训练与视频生成。团队构建PhysCapBench基准,含246段物理视频、3794条人工核验原子断言,描述准则自进化使F1从78.64提升至87.82。基于Cosmos3的版本在Physics-IQ Verified排名前两位,四项物理评测取得开源SOTA,三项总分超过Veo 3.1。
15、被a16z看中,上线三周的Jev拿下75亿美元估值
TypeSafe AI旗下模型Jev于9月15日开放早期访问,10月9日公司宣布完成8.7亿美元A轮融资,投后估值达75亿美元,由a16z领投,红杉资本和DCVC跟投。Jev上线三天处理1万亿个Token,数日内用户超100万,约三分之一财富500强企业已使用,并已实现盈利。创始人迪奥戈·阿尔梅达曾参与OpenAI InstructGPT研发,主张可组合AI。
16、差了200亿美元!OpenAI年化营收数字打架,英伟达跌近3%
英国金融时报披露OpenAI向投资者提供的文件显示,截至9月底其年化营收接近500亿美元,低于此前路透社等报道的接近700亿美元,差额约200亿美元。差异主要来自云平台合作收入统计口径:Anthropic采用总额口径,OpenAI采用净额口径。消息加剧市场对AI增长的担忧,当日英伟达跌约2.9%、甲骨文跌约5.5%、纳斯达克综合指数跌1.25%。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
10月09日AI资讯 | 星动VPP2登顶;谷歌发Gemini Agent;GPT-6.1上线;Claude Haiku降价90%
- 作者:AI学长小林
- 链接:https://ai.linbintalk.com//article/3f5629a6-152d-8137-a4f9-df5fedc892f8
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

