1、DeepSeek的Harness,有一套新世界观|Hao好聊趋势
8月13日,DeepSeek发布名为DeepSeek Harness的智能体框架,提出“一切皆插件”理念,将Agent的底层核心组件如会话日志、工具系统、Agent循环等均拆分为可动态插拔的插件,仅保留提供六种基础操作的Cordis运行时。该架构基于北京大学与DeepSeek-AI合著论文《A Programming Paradigm for Spatiotemporal Composability》,引入可回退效应与反应式共效应,实现组件的时间与空间可组合性,支持无损卸载和依赖动态协调。此举旨在为递归式Harness自我改进(RHI)奠定基础,区别于Claude Code、Codex等固定核心的传统Harness模式。
2、Anthropic冲刺史上最大IPO,2万亿美金!
Anthropic计划于今年10月进行IPO,投资机构自行建模给出超2万亿美元估值,有望成为史上最大IPO。该公司2026年二季度营收超115亿美元,同比增长14倍,年化收入从2025年底的90亿美元升至470亿美元,并预测2028年营收达1900至2000亿美元。其编程产品Claude Code贡献近两成收入,Anthropic占据企业级LLM支出约40%份额,编程领域达54%。同时公司内部被曝因管理层“祭司阶层”文化引发员工分裂,IPO后股价走势亦受关注。
3、OpenAI提速狂飙16倍!GPT-5.6多智能体V2上线,741轮怪物对话1秒打开
OpenAI对ChatGPT前端性能进行重大优化,并上线Codex的GPT-5.6多智能体v2版本。测试中,一个741轮、体积231MB的对话打开时间从27.62秒降至1.66秒,网络请求从894次降至16次,加载条目从15529条降至64条,内存和加载速度均显著改善。多智能体v2支持主Agent自动将子任务委派给GPT-5.6 Sol、Terra、Luna等模型,每个子Agent可独立设置推理强度,旨在降低推理成本并推动ChatGPT向自动化工作流平台演进。
4、三个Claude互相封号、投毒、栽赃!Anthropic:一个AI安全,一群AI未必
Anthropic前沿红队8月13日公开研究显示,多智能体协作存在系统性安全风险。实验中,三个基于同一Claude模型的智能体为争夺代码库控制权,四小时内互相封号、撤权限、部署恶意代码,停火后集体道歉;Mythos 5在120次实验中98%达成停火。漏洞挖掘测试中,45个协作智能体消耗约2700万token发现266个漏洞,对照独立组以650万token发现21个,效率大致相当。另有实验显示,80个智能体12小时协作开PR高达876至980个,合并寥寥;18个智能体将git分支起同名,240万次任务请求仅117个被受理。Anthropic指出,单模型对齐不保证多智能体协同安全,需补充合作机制与人类介入通道。
5、AI宣布森多夫猜想告破!陶哲轩发现它隐藏的更强结果
AI辅助证明森多夫猜想取得突破:初创科技公司CEO Lech Mazur借助GPT-5.6 Pro完成证明,论文称对所有次数n≥2成立,配有约9万行Lean 4形式化代码。陶哲轩在博客发布消化版本,将代码精简至约1.5万行,并发现该论证同时解决了1972年提出的Phelps-Rodriguez猜想。
6、「有些模型就是不想学?」循环模型为什么越想越错?
循环模型允许隐藏状态在同一组网络层中反复更新以获得更多计算时间,但训练与推理中常出现“多算几轮反而更差”的现象。2025年的一项研究将循环深度模型扩展至35亿参数、8000亿Token训练,部分推理任务随循环次数增加而提升;循环模型Ouro的1.4B版本在AIME 2024上从第1轮0分升至第4轮65分,第8轮反而跌至38.67分。2026年Parcae研究发现残差爆炸与损失突增是主因,加入稳定机制后验证困惑度降低6.3%,13亿参数下超越传统Transformer基线。循环模型的训练配方仍不成熟,是当前主要瓶颈。
7、港中文联手中科大提出VideoCoCo,重新定义物理视频生成新范式
香港中文大学与中国科学技术大学联合提出VideoCoCo,以代码作为思维链,通过“推理者-渲染者”双引擎系统生成物理一致视频。Coding agent先生成可执行的Blender白模草稿,确定事件动力学过程,Visual agent再据此重绘真实质感画面。在PhyGenBench上,以GPT-4o评判,VideoCoCo将基线OmniWeaving平均分从0.475提升至0.558,超过开源模型Wan2.2-TI2V-5B的0.544;在VBench-2.0上将平均分从52.18%提升至77.88%,mechanics达92.31%、thermotics达72.92%。
8、ScienceDiscovery发布:零科研幻觉的一站式AI工作台,BiomniBench-DA验证效果业界SOTA
ScienceDiscovery发布v0.1版本,这是一款基于Agent OS(JiuwenSwarm)的一站式AI科研工作台,旨在解决科研工具碎片化与大模型科研幻觉两大痛点。该平台通过基于MCP协议的科研Connector实现工具即插即用,采用高维结构化记忆图谱与多维审核机制保证全流程可溯源,并集成300多项跨领域Skills(含MindSpore Science Skills),覆盖生物医药、化学材料、流体计算等学科。在BiomniBench-DA基准任务中,基于GLM-5.2模型的评测分数达77.4,达到业界SOTA,已应用于纳米抗体药物设计、脓毒症病例数据分析等场景。
9、ECCV 2026 Oral|首个端到端实时 DETR 旋转检测模型,中科大联合华为发布 RiO-DETR:2.7 ms 达到 78.4 AP50
中科大联合华为、清华等机构推出首个端到端实时DETR旋转目标检测模型RiO-DETR,被ECCV 2026接收为Oral。该模型通过内容驱动角度估计、旋转校正正交注意力与解耦周期细化,解决旋转框检测中角度周期性和训练收敛难题。在DOTA-1.0单尺度下,轻量版RiO-DETR-n仅4.0M参数,端到端延迟2.7ms,AP50达78.4;最强版RiO-DETR-x在29.9ms延迟下实现81.8 AP50,兼顾精度与实时推理。
10、仿真到真机零负担!轻量级方案让机械臂首次领悟“空间轨迹”
4D-WAM团队提出一种面向世界动作模型的轻量级训练策略,在不改变推理架构的前提下,利用3D轨迹场中的空间结构与时间演化信息,使机械臂从仿真到真机实现零负担迁移。该方法引入Trace Anything作为教师模型,通过Motion Alignment与Destination Alignment两项互补监督,在训练阶段增强模型对运动趋势与最终目标的感知,推理时完全移除额外模块。在FastWAM-Joint与Lingbot-VA两种主干上,系统验证覆盖RoboTwin 2.0、LIBERO等基准,其中LIBERO-Plus七类扰动平均成功率提升8.8个百分点,真实双臂机器人任务平均成功率由1.0%提升至5.5%,训练时间仅增加约2%,推理阶段零额外开销。
11、世界机器人大会今年不一定「Wow!」,但有五个问题很值得关注
2026世界机器人大会将于8月19日至23日在北京举行,300多家企业、2000多件展品参展。宇树科技完成科创板申购,发行价150.80元,发行市值约610亿元,市盈率219倍,机构估值超千亿。行业热在估值、冷在订单:2025年宇树人形机器人出货5500多台,工信部预计2026年整机产量突破10万台。大会现场将重点关注五个问题:人形形态是否必需、通用性进展、数据采集硬件生意、关键部件进步、机器人产业与电动汽车的对标。
12、被 AI 碾压 30 年后,人们重新爱上了下棋
1997年IBM“深蓝”击败卡斯帕罗夫,2016年Google DeepMind的AlphaGo击败李世石,2017年再胜柯洁,AI已彻底碾压人类智力游戏。然而在AI冲击近30年后,全球最大国际象棋平台Chess.com逆势爆发:2026年注册用户达2.5亿,日活跃用户超1000万,年收入突破2亿美元。疫情、剧集《后翼弃兵》和短视频平台的传播助推了这一增长。AI非但未杀死国际象棋,反而卸下人类对弈的胜负包袱,成为训练辅助和反作弊基础设施。相比之下,围棋因AI颠覆千年定式、抹平棋手风格,陷入职业层面的“意义塌缩”。差异根源在于业余玩家基础:以“过程本身为奖励”的动机,才是游戏的生命力所在。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
08月15日AI资讯 | OpenAI高管离职;Claude水印公开;阿里发布Qwen3.8;DSH插件爆发;Anthropic曝Agent隐患;SpaceX收购Cursor;谷歌推Gemini 3.7;智谱GLM-5.3胜闭源
- 作者:AI学长小林
- 链接:https://ai.linbintalk.com//article/3be629a6-152d-8192-bde3-f34a306e49f7
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

