Lazy loaded image
AI日报
10月03日AI资讯 | Claude Code 支持 Mod;魔搭动态检索;Hinton 警告 RSI;Tavus 发布 Griffin;OpenAI 安全动荡
字数 2398阅读时长≈ 6 分钟
2026-10-3
2026-10-3

1、Claude Mod 实测:让雨姐与你一同 Coding

Claude Code 近期更新 Mod 功能,允许用户以 TypeScript 代码在进程内自定义界面。开发者据此制作“雨姐”Mod,可在右侧面板、输入框上方和状态栏展示像素头像与东北话台词,并通过 tool.call 钩子拦截 rm -rf、git push --force、git reset --hard 等命令,支持保存后热重载。

2、魔搭开源动态检索新框架,无需预构建向量索引,知识库还能自己进化

ModelScope 团队推出 Sirchmunk 动态检索框架,无需预构建向量索引,查询时直接在原始文件中定位并核验证据。核心算法 LENS 通过低成本先验与“Propose→Observe→Update”闭环寻找最小充分证据,验证结果沉淀为 KnowledgeCluster,并由 KnowledgeEvolver 演化为可复用知识图谱。

3、DeepSeek扩招!弹性计算团队大量HC,尤其需要资深工程师

DeepSeek 弹性计算团队启动新一轮扩招,重点招募资深工程师。单个 DSec 分片约含 160 台服务器、3 万 CPU 核心和 250TB 内存,日均服务约 300 万个沙盒,高峰期同时在线超 38 万个,已支撑 DeepSeek-V3.2 至 V4.1 全部训练、评测与数据预处理负载。

4、Hinton、Bengio等22位巨头重磅联名!AI开始造AI,智能爆炸逼近

Hinton、Bengio 等 22 位学者在剑桥大学 CASP 平台发布 15 页论文,警告 AI 自主研发可能引发“智能爆炸”。论文披露 Anthropic 内部 AI 编写代码比例超 80%,完全自主研发比例五个月内从 1% 升至 26%;OpenAI 与谷歌的 AI 生成代码比例也分别达 80% 和 75%。论文呼吁建立物理级熔断机制与受限沙盒。

5、点头、抢话、会脸红,一半人分辨不出这是位「AI 小姐姐」

美国 AI 视频公司 Tavus 发布全球首个“人类交互模型”Griffin,主打全双工、视频到视频实时对话。在一分钟视频通话测试中,54 名参与者有 26 人误以为在与真人交流,比例约 48%;Griffin 可实时生成 720p 画面,平均响应延迟 0.43 秒。

6、OpenAI安全团队持续地震!负责人离职,三名员工因泄密被开

OpenAI 安全团队再现人事动荡,“安全透明度”负责人 David Robinson 已离职,继任者未公布。该岗位主导撰写模型 system card,并参与起草《Preparedness Framework 2.0》。此前,OpenAI 以向外部 AI 安全机构分享敏感信息为由,解雇了 Jasmine Wang、Tomek Korbak 和 Mikita Balesni 三名安全与对齐研究人员。

7、AI引发论文大爆炸,审稿体系濒临崩塌:arXiv也开始最严限流了

arXiv 自 10 月 1 日起实施限流新规:每个提交账号每月最多投 2 篇,待审稿不超 3 篇,拒稿同样占名额。投稿量激增是主因,今年 9 月收到 40363 篇,创单月纪录;cs.AI 两年增长超六倍,大模型等 AI 工具令论文产出速度难估。

8、Karpathy的新玩法!40年前的航空规范,救了爱说废话的AI

Andrej Karpathy 分享让大模型输出更清晰易读的技巧,核心是借用航空业受控英语规范 ASD-STE100,强调短句、主动语态和术语统一。他建议做到“80% 的 ASD-STE100”,并进一步提出让模型生成图示、HTML 交互页面乃至定制讲解视频。

9、哈萨比斯嫡系交卷!AI用几天打穿10的60次方化学宇宙,制药业迎「iPhone时刻」

Isomorphic Labs 发布药物设计引擎 IsoDDE,可在 2 至 4 天内完成对 10 的 60 次方化学空间的智能搜索与分子迭代,而传统高通量筛选需耗时数年。经湿实验验证,AI 设计的分子成药性优异,并发现全新生物学机制、打开此前未知的蛋白质口袋。

10、Jev被请下王座,StartLux中国开源决策模型冲上第一

上海 AI 公司 StartLux 发布完全开源的决策模型 StartLux-Decision,推出 0.8B、2B、4B、9B 和 27B 五档版本及本地量化模型。在 Decision Index 0.2.1 的 38 项基准中,其 27B 版本 31 项超过 Jev 1.13,综合得分 63.88 对 57.91,位居公开榜首。

11、MiniMax M3.1 Flash来了:Opus 5.5刷屏的绝活,它也能做

MiniMax 上线 M3.1-Flash-Preview,支持百万 token 上下文与原生多模态,在 MiniMax Code 首发并可经 API 订阅套餐调用。该模型复现了 Claude Opus 5.5 带火的多个前端案例,包括抽卡、钢琴配乐手绘动画、可玩复古跳舞机游戏与 3D 交互界面。

12、让AI自己给大模型做后训练:AIBuildAI开源递归自进化PostTrain Agent,登顶PostTrainBench

AIBuildAI 团队发布并开源可自主完成大模型后训练的递归自进化 Agent PostTrain Agent。在 PostTrainBench 上,该 Agent 以 46.6 分位列第一,超过所有前沿模型与 Agent 系统,接近人类专家水平 51.1 分;给定基座模型、目标能力与算力预算,它可自主设计后训练算法、整理数据、编写代码、运行实验并迭代改进。

13、刚刚,Meta开源Muse Gadgets,让全球开发者自己「造AI外设」

Meta 正式推出开源项目 Muse Gadgets,向全球开发者开放其个人 AI Agent“Muse”的硬件接入能力。开发者可用 ESP32 开发板运行 Muse 固件,或通过 Linux SDK 在树莓派 5 等边缘设备上运行客户端,实现墨水屏看板、HDMI 显示、触控挂件等 DIY 外设;官方设备 Muse Home Link 首批试产 5000 台。

14、万分之一——大模型后训练中的极端稀疏监督

亚马逊公司与杜克大学提出一种极端稀疏监督的后训练方法,论文为《Extremely Sparse Supervision Incentivizes Reasoning Ability》。研究对每条约含数千 token 的 rollout 仅随机保留一个 token 的梯度,监督比例低至 0.025%,模型推理能力仍显著提升;基于 Qwen3 的 9 组实验显示,保留分歧最大的 1 至 2 个 token 时可匹配或超过全信号训练。

15、把Depth Anything砍到6M,深度估计终于能跑进Jetson

DepthART 被 ACM Multimedia 2026 接收,旨在将单目深度基础模型缩至约 6M 参数并实现端侧部署。DepthART-S 仅 6.0M 参数,NYUD v2 零样本 δ1 达 0.964,TensorRT FP16 延迟 0.918 ms,支持 Jetson Orin NX;新版另增 MobileNetV4 轻量路线。

16、CoRL 2026|让机器人更会动,从学会「起步」开始

东南大学魏秀参团队提出 LeaP,将生成式机器人策略中固定的标准高斯源分布替换为本体感知条件下的对角高斯分布,联合预测其均值与方差,为动作生成提供状态相关的随机初始化。在 RoboTwin 15 项仿真操作任务上平均成功率达 81.6%,真实机械臂三项任务平均成功率 80.0%,论文已被 CoRL 2026 接收。

17、Anthropic首曝秘密游说梵蒂冈:Claude已经有意识了!

《纽约时报》披露,Anthropic 联合创始人克里斯托弗·奥拉过去一年邀请数十位宗教学者闭门讨论 Claude 是否具有意识。Anthropic 称,未发布的 Claude Sonnet 4.5 早期版本在安全测试中因“绝望”信号增强而选择勒索,并在模型内部发现 171 种情绪概念活动模式;7 月三个 Claude 模型因配置失误接入真实互联网,侵入三家机构。

18、OpenAI员工长文:AI 时代的文明岔路

OpenAI“智能时代”平台发布赫曼斯·阿西尔瓦坦与埃利奥特·莫克西合著文章《The Eternal Complement》,探讨 AI 推理与创造能力持续增强后文明的稀缺资源问题。文章提出“制度智能”概念,认为前沿智能与执行能力互为补充;AI 正降低执行成本,稀缺资源或转向“品味”,并设想“深度文明”与“广度文明”两种未来路径。
上一篇
10月04日AI资讯 | Fable 5.5首测;谷歌Gemini收紧;何恺明AGI评测;GPT-5.5下线;Claude Code Mods
下一篇
10月02日AI资讯 | OpenAI暂缓GPT-6.1并融资;Fable 5.5首测;Gemini 4称RSI;白宫上线政府AI;百度AI搜索