Lazy loaded image
AI日报
10月11日AI资讯 | 陶哲轩提数学2.0;算力争夺加剧;Claude组队查Bug;GPT-4o停用快照;Jev获OpenAI跟进;17大AI实验室评测翻车
字数 2122阅读时长≈ 6 分钟
2026-10-11
2026-10-11

1、陶哲轩:数学2.0时代已至!

菲尔兹奖得主陶哲轩提出“数学2.0”,认为AI正让数学证明由稀缺走向泛滥,数学1.0时代将落幕。他以OpenAI一次发布722篇数学论文、把王虹解决的三维挂谷集猜想扩展至四维为例,指出AI冲击原有评价体系,呼吁建立更透明评估机制,并将失败结果与算力成本纳入报告,同时牵头成立人类数学协会抵制OpenAI。

2、硅谷AI现状:谁有算力谁是爹

硅谷AI算力争夺持续升温。Anthropic CEO Dario Amodei向Meta寻求算力未果,转而通过SpaceX获取英伟达GPU资源;谷歌斥资27亿美元招回的Transformer作者Noam Shazeer因算力分配转投OpenAI。H100一年期租赁价格从每GPU每小时1.70美元升至2.35美元,涨幅近40%,算力紧缺推高初创成本,YC等机构开始自建或囤积GPU集群。

3、Claude自己组队查Bug!11.6万行代码揪出66个,单Agent最高只找到27个

Anthropic公布测试:在11.6万行代码中预埋70个Bug,单Agent三次分别找出14、15、27个,动态工作流三次均查出66个。Claude Managed Agents动态工作流公测,支持主Agent编写分工程序、组织多Agent协作,单次累计最多启动1000个Agent,并发线程上限64;Managed Agents按Token用量及每会话每小时0.08美元运行费计费。

4、下架8个月,GPT-4o的拯救行动居然还在继续

GPT-4o从ChatGPT下架近8个月后,OpenAI将于10月23日停用其最早API快照,但“Keep4o”行动仍在继续。支持者提出“存档式开放权重”方案,要求公开已训练模型权重;Change.org请愿已有23930人签名。OpenAI曾称每天仅0.1%用户选用GPT-4o,迄今未回应开源或保留诉求。

5、前OpenAI员工做出不会聊天的AI!刚融8.7亿美元,上线两周老东家就跟了

前OpenAI员工Diogo Almeida联合创办的TypeSafe AI完成8.7亿美元A轮融资,估值75亿美元,a16z领投。其Jev不做聊天,专供软件快速判断并返回选项或概率,每百万输入token收费0.042美元,输出免费。两周后OpenAI推出Decisions API并公开Beta,承认受Jev启发,基于GPT-6 Luna,支持图片输入。

6、全球17大顶级AI实验室大逃杀!惨遭集体翻车,GPT-5.6与Opus断层领先

NUS、NTU与GaugeForge联合团队提出“验证自治”,搭建虚拟量子实验室Quantum-Harbor和QIQCBench,以49项真实量子工程任务评测17个AI Agent,涵盖GPT-5.6、Claude Opus、DeepSeek-V4、千问、混元、Kimi、智谱GLM、字节Seed等。评测显示通过率从最高78%跌至3%,GPT-5.6与Opus断层领先;1510次失败中937次因耗尽预算或死循环。

7、从「刷榜」到「做科研」:研究员还有多久被 AI超越?

OpenRSI Index基准从Marin、Qwen、GPIC等真实开源项目出题,让科研智能体改进人类设计的模型训练方案,覆盖预训练、后训练与图像生成,单次运行算力达5815至20864 H100·小时。其采用工作区与独立验收环境隔离机制,提交后由干净评测环境打分。导师包括Luke Zettlemoyer、Karthik Narasimhan、Yejin Choi、Dawn Song等。

8、EMNLP'26 Oral | 麻省理工:靠访谈让AI模拟真人,这条路能走多远?

麻省理工等机构研究者提出HugAgent,检验大模型能否基于访谈模拟真实个体并预测其在未见过的新情境中的回答。研究覆盖54名参与者、1742个评测项,测试GPT、Claude、Gemini、DeepSeek、Llama、Qwen等模型。个人访谈能提升对当前信念的推断,最佳准确率77.56%;但预测条件变化后的信念更新更难,最佳Claude Sonnet 4.5为68.61%。

9、中科大团队把会「倒推」的世界模型塞进了机器人,成立三个月拿下数千万融资!

合肥公司白泽通境推出具身大脑方案,包含溯因式世界模型AWM、端侧推理引擎BAIZ-RUN和计算终端。AWM从无标注视频学习,在Push-T任务中用2000条轨迹达75%成功率,14728条时约92%;BAIZ-RUN实现2-bit权重、4-bit激活,在AMD边缘显卡上内存占用降低2.56倍,推理频率提升94.6%,精度损失不到1%。已签约三个工业场景并获数千万融资。

10、比Jev更爆火!逆向灭霸 REA 一天登顶GitHub

GitHub项目REA(Reverse Engineer Anything)上线第三天累计星标接近8万颗,登顶GitHub Trending榜首,同期下载量约4.4万次。该项目基于MCP协议,将大模型与Ghidra、Hopper等逆向工具结合,可自动反编译商业软件二进制、APK及固件,并输出可用的开源实现代码。此举引发对闭源软件护城河、知识产权保护及代码混淆趋势的讨论。

11、灵光开始内测 Personal Agent

蚂蚁旗下灵光App开始小范围内测Personal Agent,计划本月全面开放。新版底部新增“我的生活”Tab,用户在聊天框输入“安装米家API”即可接入开源库mijiaAPI,获得米家设备操作权限。内测中识别出13台米家设备,并调用小米激光打印一体机K200打印A4文档;还支持类IFTTT自动化、电商比价、机票监控。

12、田渊栋:与GPT-5合写最后一篇论文后,我意识到自己5年内会失业

前Meta FAIR研究员田渊栋透露,他将GPT-5作为合作者完成Meta最后一篇论文后,研究效率提升约6至10倍,并判断自己的工作约五年内可能被AI取代。为此,他已联合创办Recursive Superintelligence,该公司今年5月以46.5亿美元估值融资超6.5亿美元,GV和Greycroft领投,英伟达和AMD参投。

13、离谱,Claude半年封杀1140万账号!申诉后仅4.2万翻案

Anthropic在2026年上半年累计封禁1140万个Claude账号,日均超6万个账号被关闭。同期收到39.8万次申诉,仅4.2万次成功,成功率约10.5%。封禁原因涉及违规内容审查、黑产号及区域限制等。不少开发者反映申诉流程仅通过表单提交,拒绝理由多为模板回复,导致依赖Claude的Agent工作流无法访问。

14、机器人伸手时,杯子被挪走了:LIBERO-MAX用22.4万次仿真检验动态可靠性

斯坦福、CMU、MIT等机构研究者提出机器人评测基准LIBERO-MAX,将执行中途的环境变化纳入测试,基于LIBERO-Plus和LIBERO-PRO构建8000组配对案例、8类变化,涵盖目标移动、视角改变与传感器噪声等。团队评测14种机器人策略,累计22.4万次仿真,所有策略成功率下降11.0至25.7个百分点;动态条件下表现最好的MolmoAct2和π₀.₅分别仅66.9%和65.7%。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
10月10日AI资讯 | LeCun开源H-JEPA;OpenAI数学成果引争议;谷歌Gemini 4曝光;西湖机器人灵巧手叠衣;OpenAI dots登陆手机;Nano Banana 2.1发布;Jev估值75亿美元;Claude绘紫外全天图;AI安全与RSI升温