Lazy loaded image
AI日报
10月08日AI资讯 | GPT-6全面开放上线智能UI;Claude Haiku 5.5降价九成;华为披露AI芯片牌局;Mistral发布万亿参数模型;Manus融资5亿美元
字数 2664阅读时长≈ 7 分钟
2026-10-8
2026-10-8

1、刚刚,GPT-6全面开放!免费用户也能用了

OpenAI 宣布面向全球所有 ChatGPT 用户开放 GPT-6,包括免费和付费用户,取代此前的 GPT-5.6 Sol 和 GPT-5.6 Luna。Plus、Pro、Business 和 Enterprise 用户主要由 GPT-6 Sol 支持,Free 和 Go 用户主要由 GPT-6 Luna 支持。此次升级的核心新能力是 Intelligent UI,可自动组合文字、图片、图表、按钮、表单等元素生成可交互界面,还能按需创建计算器、分摊工具等即时应用。OpenAI 称 GPT-6 支持边思考边作答,在网页搜索场景下平均开始作答时间比 GPT-5.6 Instant 提前 44%。ChatGPT 每周用户已超 12 亿。

2、刚刚,Claude Haiku 5.5发布!价格暴降90%

Anthropic 发布 Claude Haiku 5.5,主打高吞吐、低延迟、低成本,输入每百万 Token 0.10 美元、输出 0.50 美元,单价为上一代 Haiku 4.5 的十分之一,与 OpenAI GPT-6 Luna 同价。官方跑分中,OSWorld 电脑操作从 15.7% 升至 72.4%,Terminal-Bench 4.0 达 39.2%,GDPval-AA 拿下 1620 分,HLE 从 10.2% 升至 45.9%,在 Luna 提交成绩的六项中全部胜出,但复杂编程仍落后于 Sonnet 5.5 的 70.6%。模型 ID 为 claude-haiku-5-5,上下文 100 万 Token,已在 Claude 客户端及 AWS、谷歌云、Azure 等平台上线。

3、华为的芯片与AI牌局

华为轮值董事长徐直军与终端BG董事长余承东近期密集发声,强调华为在受限制程下通过多芯片互联、系统架构与超节点集群路线提升整体算力,昇腾、麒麟芯片在能效与系统级性能上已有显著提升。与此同时,DeepSeek与华为合作开发并开源面向昇腾的底层软件工具,从模型适配走向共同建设计算基础设施。国际能源署数据显示,五家大型科技公司2025年资本支出超4000亿美元,AI竞争正从单颗芯片转向系统与生态。此外,AMD以约82亿美元全股票交易收购李飞飞领导的World Labs,进一步印证基础设施竞争升温。

4、1万亿参数「肥猫」单挑GPT-6和Claude!多项测试赢了

法国AI公司Mistral发布新旗舰模型Mistral Large 4,总参数达1万亿,采用混合专家架构,每token仅激活490亿参数,权重将于月底开源。该模型在Artificial Analysis智能指数中获38分,追平GPT-6 Luna,位列欧美开源模型第一。在网络安全基准Cybench上解出93%,漏洞复现测试中拿下82%,而GPT-6 Astra与Claude Opus 5.5均拒答。其在法律、金融、视觉定位及科学编程等测试中亦超越GPT-6与Claude Opus 5。模型使用3800块英伟达Grace Blackwell从零训练,预览版API已上线,定价为每百万token输入1.36美元、输出4.18美元。

5、官宣5亿美元新一轮融资,Manus开启下一程

10月8日,Manus母公司蝴蝶效应宣布完成超5亿美元新一轮融资,博裕投资、IDG资本领投,腾讯、红杉中国、真格基金继续加持,目标估值约40亿美元。9月28日,公司推出Manus 2.0和独立个人智能体应用Cue,并宣布组建国内产品团队,推进与国产模型厂商及生态伙伴合作。9月1日Manus刚恢复独立运营,创始人肖弘重申其“通用智能体”定位。同期公司公布17个北京岗位,覆盖产品、研发、运营与增长。

6、谷歌把AI搜索塞进手机!不到600MB,照片、视频、录音断网照样搜

10月6日,谷歌开源首个原生多模态嵌入模型EmbeddingGemma 2,参数740M,量化后完整多模态模型内存占用约567MB,可在手机、笔记本离线运行。模型将文字、图片、音频、视频映射到同一768维空间,支持8K上下文和100多种语言,图像检索得分57.3、视频检索50.7,均领先Jina v5 Omni-Nano;代码检索MTEB Code从68.76升至78.68。开发者实测浏览器端查询仅需22毫秒,有用户将其用于跨语言笔记检索,命中率由15%提升至97%。

7、Claude打通谷歌办公三件套!文档表格PPT直接改

Anthropic于10月6日宣布,Claude接入Google Docs、Sheets和Slides,面向Pro、Max、Team和Enterprise全部付费计划开放公开Beta。用户安装插件并授权后,可在三个应用的侧边栏内直接让Claude改稿、修公式、补页面,也可在聊天窗口粘贴文件链接或新建文件。Claude能精简摘要、统一样式、按团队生成工作表并标出超预算项、结合Salesforce资料生成季度汇报。修改默认需用户批准,并记录于Google版本历史。侧边栏新增图表为图片,不会随表格数据自动更新。

8、谢扬的新产品 Qoni:给 Agent 发一张工牌

谢扬推出 Personal Agent 基建产品 Qoni,核心是为 Agent 发放“工牌”。Agent 执行任务前向 Qoni 换取仅针对特定事务和时段、可随时撤销的临时通行证,操作记在授权用户名下。例如 Dana 授权 Agent 跟进 Acme 客户,15 分钟内可读资料、发邮件,删除操作被拦截,09:44 撤销后工牌作废。Qoni 还托管来自 Fellou 的云端浏览器与长期记忆 GUMem,并为 Agent 配邮箱、手机号以注册 Salesforce、飞书等 SaaS。同日 ChatGPT 上线交互 UI。

9、Einsia AI发布世界模型终极大考!直面「物理规律理解」,最高仅57分

Einsia AI 旗下 Navers Lab 发布新基准 "World Models' Last Exam in Physics",以 40 个任务、9 类物理现象测试 8 个视频生成模型。总分由一致性(占 15%)与物理分(占 85%)构成,物理分通过提取视频中的轨迹、周期、液面等物理量并检验其关系得出。Seedance 2.5 以 57.76 分居首,MiniMax H3 以 54.89 分次之。相变任务中仅 Seedance 2.5 得 95.61 分,其余模型最高 15 分;自由落体任务平均一致性达 98.75 分,平均物理分仅 13.88 分。

10、首篇自回归视频生成Memory综述来了,港科大、城大、复旦、CMU、NYU、NTU等联合出品

香港科技大学、香港城市大学、复旦大学、CMU、NYU、NTU等机构联合完成首篇自回归视频生成Memory综述《The Past Frames the Future: Memory for Autoregressive Video Generation》,全文110页。综述将长视频生成、流式生成和交互式世界模型中的记忆研究统一到Memory框架,从形式、功能、操作、学习和评估五方面梳理,划分视觉、隐式状态、显式状态、自适应参数四类记忆载体,并覆盖身份、空间、动态、语义与因果保持等功能,指出长期一致性不等于真正记忆,需通过信息缺口评估验证。

11、AI让数学再也回不去那个旧世界了。

10月7日,OpenAI无预警在GitHub发布openai/math仓库,公开722份数学手稿,归为372个成果组,覆盖数论、代数几何、实分析、组合数学、理论计算机、数学物理和偏微分方程等方向。这些成果由其未对外发布的内部模型生成,模型从约4000个数学开放问题中筛选,单个结果平均消耗约3小时ChatGPT Pro级思考算力。其中“准黎曼猜想”相关成果引发数学界广泛讨论。

12、USENIX Security 2026|上海创智学院×复旦大学给智能体装上轨迹「安全规则审计员」:让Agent的行动可审计、可解释

上海创智学院与复旦大学团队提出移动/GUI智能体轨迹安全审计模型MATE,论文发表于USENIX Security 2026。该模型将任务指令、执行轨迹与自然语言安全规则联合建模,输出违规判定、风险类别及基于轨迹证据的审计解释,提供0.5B、1.5B、3B三种轻量规模。团队从158个中英文App合成超14万条规则条件化轨迹,并构建中英双语基准MATEBench,覆盖3大类14类移动智能体风险,真实轨迹涉及智谱AutoGLM与阿里巴巴Mobile-Agent。

13、NeurIPS 2026 Spotlight|拒绝模型「自作主张」,VisInteract用交互搜索找回意图

香港理工大学与字节跳动团队提出动态交互式文本到可视化新范式 VisInteract,并发布基准 VisInteract-Bench,含 1098 条样本、11 个数据库、75 张表,覆盖 7 个领域,约 61% 样本含歧义、69% 含事实错误。团队进一步提出基于蒙特卡洛树搜索的 Vis-MCTS,使系统在查数、画图和追问间分叉与回退,主动找回用户意图。该工作被 NeurIPS 2026 接收为 Spotlight(292/30709 投稿)。在 Qwen3.5-flash 和 Gemini-3.1-flash-lite-preview 上,Vis-MCTS 在代码、图表及综合口径均取得最佳结果,图表可渲染率为 100%。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
10月07日AI资讯 | 辛顿警告AI自造AI;OpenAI发722篇数学成果;Claude证渗流猜想;谷歌发Nano Banana 2.1;OpenAI API降价;Mistral发1T模型;4B模型下棋近大师;AI影视模型全球第二