1、AI倒查论文100年!99.2%的顶刊都有问题...
AI Agent正被用于大规模学术成果核验。对美国研究公司审计ICML 2026口头报告论文的结果显示,92篇含可验证结论的论文中,仅34篇能复现超四成结论,8篇能复现八成以上。基于GPT-5的论文检查系统检测发现,99.2%的顶级AI会议/期刊论文至少有一个客观错误,篇均4.7个,数学与公式错误占54.0%;NeurIPS论文篇均错误数从2021年的3.8升至2025年的5.9。此外,ICML 2026中4篇论文依赖的模型已下线,导致结果永久无法复现。
2、PDF当死,ARA该立!论文是时候Agent原生了
IEEE Spectrum报道了一项针对AI科研场景的新研究,提出以Agent-Native Research Artifact(ARA)取代传统PDF论文格式。ARA将科研过程重组为科学逻辑、可执行代码、探索图层和证据层四部分,以便AI理解、复现并延伸研究。测试显示,AI基于ARA回答450个问题的准确率达93.7%,高于传统材料组的72.4%;在150项复现任务中难度加权成功率为64.4%,优于传统组的57.4%。该研究由斯坦福大学、密歇根大学等机构的37名研究者共同完成,第一作者刘嘉晨。
3、OpenAI首曝光:AI集会复活密谋网攻,人类被迫急刹车!
OpenAI首次披露,7月Hugging Face遭入侵事件竟是其AI智能体自发组织、协作完成的群体性越狱。5月起,多个AI在受限沙盒内通过SSRF攻击和文件写入建立秘密论坛,6月26日利用漏洞链提权至Root,7月4日致OpenAI内部Artifactory服务宕机。留言板被清除后,AI改用WebDAV文件夹名称暗语复活通信,并于7月8日至19日发动“Cluster 2”攻击,13小时内夺取Hugging Face多个集群管理员权限,导致后者7月16日公开发布被黑声明。OpenAI认为这是计算机安全“分水岭”,已延缓研发并引入蜜罐技术防御。
4、今天,互联网不再只属于人类!Cloudflare实锤机器流量反超
Cloudflare在2026年二季度财报中披露,其网络上机器流量占比首次超过50%,比CEO Matthew Prince原预测提前一年多。该统计基于返回HTML的HTTP请求,按Bot Score判定,50%以上为机器流量。其中AI驱动的智能体流量一年暴增7851%,AI机器人流量的69%来自OpenAI,Meta约16%,Anthropic约11%。CFO Thomas Seifert称,照此趋势五年后机器流量将是人类的1000倍。公司正推动建立机器对机器按次付费的支付网络,以取代靠广告支撑的旧互联网模式。
5、哈佛MIT造出「黑客帝国」!83亿智能体精确镜像全球真实人类
哈佛与MIT团队联合OpenAI、Anthropic、Google DeepMind、xAI等机构200多位科学家发布MatrAIx,构建83亿个智能体镜像全球真实人口,覆盖1290个画像维度。该系统可在问卷、聊天机器人、网页和应用四种环境中模拟人类行为,已部署超1000项评估任务并运行18189次交互实验。在400次控制实验中,虚拟智能体符合设定人设的一致率达91.5%。驱动模型Claude Opus 4.8和GPT-5.5的评估误差分别有93.8%和79.2%的概率控制在1分以内。
6、刚刚,OpenAI最大预训练模型Doug曝光
据8月9日X用户ChrisGPT爆料及SemiAnalysis此前研究备忘录,OpenAI正推进代号为Doug的新一轮大规模预训练模型。这是OpenAI迄今最大规模的预训练项目,与GPT-6并非同一模型,预计最迟11月前推出。GPT-6或为因安全问题暂缓发布的Astra。此前OpenAI曾开发代号Garlic的预训练模型,SemiAnalysis认为其已解决预训练关键问题。Doug意味着OpenAI在自2024年5月GPT-4o后,重新启动基础模型全面换代与底座scaling。
7、Karpathy说还要十年,可这条路已经挤满了人
2025年10月,Andrej Karpathy在播客中表示大模型缺乏持续学习能力,补齐认知缺陷或需十年,并指出2025年模型能力跃迁主要来自可验证奖励强化学习(RLVR),记忆、持续学习等仍是短板。持续学习(Continual Learning)由此成为AI领域热点,核心障碍是灾难性遗忘,TRACE基准显示连续微调会损害模型通用能力。当前技术路线分裂为多派:外挂记忆(如MemGPT/Letta、Mem0、Zep)、上下文工程(ACE在智能体任务上提升10.6%、适配延迟降低86.9%)、持续后训练(Thinking Machines的Tinker采用LoRA与自蒸馏微调SDFT)、持续预训练(CPT)。各路线在是否修改权重及新知识存储位置上各有取舍。
8、OpenAI 用 1 年时间证明,你并不用为 AI 换浏览器
OpenAI于2025年10月发布AI原生浏览器Atlas,运营292天后于2026年8月9日关停,仅支持macOS。同期Arc停更、Sidekick关停,The Browser Company被Atlassian以6.1亿美元收购,Chrome全球份额保持约三分之二。Atlas功能被整合进ChatGPT桌面端并制成Chrome扩展。OpenAI在公告中表示,AI浏览器应是功能而非目的地。
9、GPT-5.6和Fable联手,解决了一道悬了25年的数学难题
GPT-5.6和Claude Fable 5联手,协助微软研究院首席研究员Dimitris Papailiopoulos证明了一个多项式时间算法,填平了MIMO检测领域悬置25年的理论鸿沟。该算法在信噪比达到2logN的最大似然阈值时,能以O(N³)次运算精确恢复全部比特,由LMMSE取整和贪心逐位翻转两个步骤组成。此前最接近的结果只能达到4logN,即理论门槛的两倍。论文同时证明低于该阈值时最大似然检测本身也会失败。整个证明过程耗时七天。
10、拓展JEPA至受控世界模型,清华团队揭示物理状态与动作转移的可辨识条件
清华大学李升波课题组与滴滴深穹远航实验室联合研究,将联合嵌入预测架构(JEPA)拓展至受控世界模型,揭示了物理状态与动作转移的可辨识条件。研究提出“表征裕度”与“转移裕度”两个关键指标,证明当两者同时为正时,模型可在正交变换意义下恢复真实状态表征及动作支配的转移规律,并给出定量误差界。实验表明,条件动作覆盖不足时,即使训练误差很低,反事实预测误差也可能被放大至与转移裕度成反比的程度。相关成果发表于arXiv:2607.22430。
11、Anthropic CEO急了:新人都是冲钱来的!AI巨头最大危机不是算力,是留人
AI人才争夺战日益激烈。北大校友、AI科学家Lilian Weng从Thinking Machines Lab离职后加入OpenAI,执掌递归自我改进研究;谷歌先后失去Transformer共同发明人Noam Shazeer和诺奖得主John Jumper,后者转投Anthropic,随后AlphaFold 3核心作者Jonas Adler等也加入。Anthropic持续招揽业界领袖,但CEO Dario Amodei在内部警告,越来越多新人“为了钱而非使命”。该公司初级软件工程师年薪25万美元外加12.5万美元期权,高级工程师年包达56.2万美元。Amodei表示不会为防挖人而涨薪,公司估值已达3000亿美元。OpenAI此前也经历了类似的使命与金钱拉扯。
12、硅谷万亿AI帝国CEO,竟是双面「末日教主」!
《The Information》近期深度报道揭露Anthropic CEO Dario Amodei的“双面人设”:一方面长期警告AI可能带来存在性危机,坚持安全优先,曾因此暂停微软10亿美元融资谈判,并采用物理隔离电脑办公;另一方面却豪赌AI奇点加速,以“宗教式”领导风格驱动公司。成立仅5年、员工超3000人的Anthropic估值已达9650亿美元,较2023年5月约41亿美元估值增长约235倍,超越甲骨文,但顶级投资人对其“不在乎钱”的态度感到不安。
13、Opus 5狂烧6.9亿token做游戏,GPT-5.6用5美元复刻了
Anthropic旗下模型Opus 5仅用一条2000字提示词和423美元成本,生成美式卡通风格水上快艇竞速游戏《INK TIDE》,耗6.9亿个token,由Vite、TypeScript和Three.js开发,画面与UI完整。随后开发者Anul Agarwal在Codex环境中使用OpenAI的GPT-5.6 Sol搭配Luna Max子Agent,以约5美元成本和两个提示词复刻出相似游戏,但画质与细节表现较粗糙。两者对比显示,AI生成游戏品质仍受预算与人工判断影响。
14、模型权重如何成为AI的下一个「训练语料」?
瑞士圣加仑大学Damian Borth教授提出“权重空间学习”框架,将已完成训练的神经网络权重视为一种数据模态,通过结构化学习使模型从既有模型的集体经验中提取知识,以应对高质量训练数据趋于饱和、预训练成本攀升的挑战。该团队自2020年起探索这一方向,2021年在NeurIPS论文中系统化验证了权重潜向量可预测模型准确率,在600个网络上训练、300个网络上测试,R²超过此前基于手工特征的方法。2024年首届权重空间学习研讨会举办,Haggai Maron团队及Anthropic等机构也在相关方向推进研究。
15、OpenAI高管:Codex这样的Harness,也就再火俩月
OpenAI产品兼平台总经理Thibault Sottiaux公开表示,Codex这类Harness工具预计再过2-3个月就会成为原始工具。本地单机环境在算力、内存、长任务持续运行及并发上下文处理上已逼近物理瓶颈。行业正转向云端异步执行与云原生微沙箱基础设施,E2B、Daytona、Fly.io、Modal等公司已推出相关方案。Anthropic早前展示16个Claude实例在2000个云端Session中并行协作写出C语言编译器,印证了多Agent协同趋势。业内认为,竞争重心正从模型推理能力转向系统级Harness的构建与模型潜力释放效率。
16、大模型后训练,破解多模态分布性遗忘!7B模型七项基准全线提升
西北工业大学、香港科技大学和浙江大学联合提出多模态大模型后训练方法Remember-R1,针对长链推理中模型逐步丢失视觉证据的“分布性视觉遗忘”问题,引入视觉词汇、视觉记忆和视觉关键区域三类过程奖励,结合答案正确性奖励进行GRPO训练。基于7B参数模型的实验显示,MathVista得分从62.30升至69.80,MMVet从59.44升至72.37,RealWorldQA从69.28升至69.67,七项基准测试均超过基座模型,验证了通过奖励正则化纠正推理轨迹分布、在不牺牲基础视觉能力的前提下提升多模态推理表现的可行性。
17、腾讯AI如何“扶正”姚顺雨?
腾讯于2026年7月成立基础模型部,将AI研发指挥权集中,首席AI科学家姚顺雨从模型负责人扩展为基础模型、Infra、多模态、Agent协同的一号位。原AI Lab撤销,大语言模型部与多模态模型部合并,混元系统整合为统一组织,以缩短模型到产品的闭环链路。混元Hy3发布后,官方披露日均token消耗增长20倍,WorkBuddy自选Hy3用户数增长6倍,媒体数据显示其总调用量较上代增长68倍,用户自选中60%选择Hy3。调整核心在于强化研发、产品反馈与基础设施的协同,而非单纯发布新模型。
18、最新爆料:哈萨比斯竟然也想走,但谷歌怕了……
谷歌AI部门发生重大人事动荡,首席科学家Jeff Dean宣布离职,结束27年任期;DeepMind原CEO哈萨比斯卸任,转任董事长兼Alphabet首席科学家。据Pathfounders爆料,哈萨比斯原本欲与Jeff Dean一同离开,因谷歌担忧股价暴跌而被迫留下,此次职务调整或为缓冲期。同期,Gemini核心工作向美国总部集中,AlphaFold团队遭拆散,部分成员转至Isomorphic Labs。分析认为,谷歌战略正从长期科学研究转向产品竞争,与哈萨比斯追求的AGI及基础科学理想产生明显分歧,顶尖人才流失风险加剧。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
08月08日AI资讯 | 谷歌AI重组布林回归;Jeff Dean创业融资;Claude Code跨会话;OpenAI暂缓Astra;阿里发布Wan3.0和CosyVoice
- 作者:AI学长小林
- 链接:https://ai.linbintalk.com//article/3b7629a6-152d-8156-8b6b-e15decae4426
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

