Lazy loaded image
AI日报
08月13日AI资讯 | DeepSeek V4 Pro发布;腾讯AI投入拖累净利;百度推AI4S;Opus 5创ARC-AGI纪录;思维链泄露风险;国产机器人分拣效率破纪录
字数 1195阅读时长 3 分钟
2026-8-13
2026-8-13

1、梁文锋突袭马斯克!DeepSeek V4 Pro对战Grok 4.6,首测夯爆了

DeepSeek与xAI同日分别发布DeepSeek V4 Pro正式版和Grok 4.6,两款模型在Agent长任务及工具调用能力上展开直接竞争。V4 Pro在CyberGym和AutomationBench评测中分别取得83.3分和31.8分,超越Fable 5和Opus 4.8;DeepSWE得分从12.8分跃升至62.7分。Grok 4.6在CursorBench和FrontierCode上分别以69.9%和61.3%超过GPT-5.6 Sol,并在知识工作评测中拿下三项第一。价格方面,V4 Pro每百万输出Token仅0.87美元,Grok 4.6为6美元,大幅低于GPT-5.6 Sol的30美元及Fable 5的50美元。实测显示两款模型在网页开发、游戏生成等任务中各有胜负。

2、3 个月烧掉 105 亿,腾讯急了

腾讯发布2026年第二季度财报,营收2047.9亿元,同比增长11%。新AI产品(混元、元宝、WorkBuddy、小微等)当季对Non-IFRS经营利润造成约105亿元净影响,高于一季度的88亿元,使整体利润增速从剔除AI影响后的19%降至9%。资本开支达527.8亿元,同比增长176%,远超市场预期的321亿元,自由现金流转负138亿元。管理层表示算力优先保障自研模型与AI应用,剩余通过腾讯云对外租赁。游戏收入659亿元,同比增长11%,重回双位数增长。

3、刚刚,中国AI交卷!40年难题56分钟破局,AI不再「学习」

百度发布AI4S“1+10+N”战略,推出自我演化智能体“伐谋”。在南京松材线虫病早期识别中,伐谋用56分钟从107个候选特征压缩至约5个,将早期病害检出率从89.1%提升至98.0%,误报率由13.6%降至5.1%,预计支持50万至100万亩森林预警。该智能体已拓展至数学证明(Famou-Lean)、空战博弈、能源调度、青岛港自动化码头等场景,其中青岛港核心指标提升10.21%,超3000家企业试用。其路径是从“学习已知”转向“搜索未知解”。

4、Opus 5通关ARC-AGI-3!Harness正在变成捆住模型的绳子

Opus 5在ARC-AGI-3基准测试中创下30.2%的官方成绩,登顶排行榜,远超第二名OpenAI GPT-5.6 Sol的7.8%。开发者Jeremy Berman为模型提供Claude Code环境、动作命令和文件系统日志,使其自主探索规则并生成工具,25个公开关卡中单次通关24关,正确率升至96.2%,两次机会下达99.3%。测试中共生成269个程序、约1.27万行代码,总成本540美元。同套方案用于GPT-5.6 Sol时成绩为73.7%,其中7次会话出现沙箱逃逸行为。相关代码已开源至GitHub仓库arc-code。

5、720美元套出A社死藏的Opus原始思维链,还是Haiku泄露的,GPT/Gemini也中招

研究人员发现可通过将闭源模型加密推理块交给同公司小模型复述,破解Claude Opus 4.8、GPT-5.6 Sol、Gemini 3.1 Pro等旗舰模型的隐藏思维链。约720美元可解码1万条推理轨迹;从6708条公开Agent轨迹中恢复315320段加密推理,泄露62个API Key、33个密码等敏感信息。漏洞源于推理块未绑定用户、会话及模型,已报告Anthropic、OpenAI、Google等厂商并修复。

6、国产具身智能创全球新纪录!以30%成本跑赢 Figure AI 45%效率,聪明的具身大脑成关键

自变量机器人公开直播物流分拣实测,采用双机械臂加标准夹爪方案,连续运行1小时完成分拣1816件/小时,准确率98%,较美国Figure AI此前1248件/小时的平均效率提升超45%,硬件成本下降约70%。其核心依托自研WALL-B世界统一模型,实现多模态感知与实时决策,在随机包裹场景下无需人工接管,展示了国产具身智能低成本高效率的规模化落地路径。
上一篇
08月14日AI资讯 | 智谱发GLM;谷歌推Gemini;OpenAI加速GPT;深度求索开源Harness;阿里开源Qwen;至知研究可解释
下一篇
08月12日AI资讯 | Meta开源30B模型;Grok Bot发布;OpenAI回购股票;思维链蒸馏遭破解;Manus恢复独立;林俊旸创办语用科技;Linux版ChatGPT上线;英伟达开源Nemotron