1、对话刘靖康:镜头之外的「智能」和「审美」,才是 Camera Agent 的主战场
影石Insta360创始人刘靖康在AGI Playground 2026上提出,未来影像设备将走向“前轻后重”,并发布“打造Cameraman”产品愿景,即通过AI实现“更简单操作+更好交付”的Camera Agent体验。影石已尝试云端AI剪辑服务,收费标准为6元/条,前两个月灰度测试完成数十万条剪辑,导出率超过50%。刘靖康认为,Cameraman无需通用大脑,相比执行标准化任务,“审美在线”更为关键,同时需加深对人类在物理世界中审美期待的理解。
2、等等,MiniMax H3不是刚发布吗?怎么就卷到几分钱的价格了……
秘塔AI上线MiniMax H3视频生成模型,支持网页端直接使用,无需本地部署或配置环境。该模型为MiniMax首个开源视频模型,具备2K分辨率、原生双声道及多模态编辑能力,曾在Artificial Analysis榜单视频编辑排名第一。价格方面,768P方案低至0.09元/秒,生成5秒视频成本不足五毛;2K方案为0.15元/秒,10秒视频约1.5元。API接口同步开放,并支持接入ComfyUI工作流。
3、李飞飞最新访谈:人也不全靠现实数据学习啊
李飞飞在a16z访谈中阐述空间智能愿景,其创立的World Labs收购机器人仿真公司SceniX,共同为机器人构建可规模化数字训练场。双方将整合World Labs的生成模型Marble与SceniX的real-to-sim-to-real管线,解决机器人训练与评估数据匮乏难题。李飞飞强调,机器人是空间智能落地的第一块试金石,需释放缩放定律力量,仿真环境在可靠性和效率上优于真实评估,且基础设施比具体模型更具长期价值。
4、突发,Jeff Dean离职创业!谷歌股价应声蒸发1.34万亿
谷歌传奇人物、谷歌DeepMind和谷歌研究院首席科学家Jeff Dean宣布离职,与Sanjay Ghemawat、Quoc Le、Oriol Vinyals三位AI元老共同创办公益性公司Discovery Loop,致力于实现机器学习、科学和工程的自动化。同日,谷歌DeepMind CEO哈萨比斯卸任原职,转任DeepMind董事长兼Alphabet首席科学家,其职务由Koray Kavukcuoglu接任。消息公布后,谷歌股价下跌4%,市值蒸发约1860亿美元(约合1.34万亿人民币)。谷歌已入股Discovery Loop并成为其云合作伙伴。此前,Gemini核心成员Noam Shazeer、John Jumper等已相继离职,谷歌正面临来自OpenAI和Anthropic的激烈竞争。
5、15岁进少年班,97后打造「元点机器人宇宙」:全栈技术自研领跑家庭机器人赛道
元点机器人(Zeroth)近日发布两款家庭具身智能产品:全尺寸人形机器人Jupiter(身高165cm、体重55kg)与全球首款异构机械臂家庭协作机器人N1。后者可拆分为两个独立工作单元,支持动态避障与记忆系统。其背后公司乐享科技由97年出生、15岁入读西安交大少年班的郭人杰创立,成立不足一年半累计融资10亿元,在手订单超3万台,已形成覆盖小型人形、履带移动及全尺寸人形的产品矩阵,并自研六大方向全栈技术体系。
6、全球首个,连续时间具身世界模型!任意帧率自由生成
清华大学智能产业研究院与UC Berkeley BAIR团队提出ODEWorld,据称是全球首个连续时间具身世界模型。该模型采用Physical-Time Flow范式,学习潜状态关于真实物理时间的导数,可通过ODE求解器积分生成任意帧率视频。在LIBERO实验中,ODEWorld生成64帧仅需0.072秒,约为LDP的1/55、V-JEPA2的1/8.6;长时预测PSNR达19.46,优于对比方法。模型还支持时间补全与反向生成。
7、走出数学与代码,大模型还能自我进化吗?
大模型自我进化研究提出RLSVR训练框架,通过任务变换为开放式任务构造自可验证奖励,并给出自博弈实例SpyRL。SpyRL采用信息不对称的多智能体博弈,使模型通过身份判断获得确定性奖励,可用于摘要、创意写作和数学推理。在Qwen3-4B和Qwen3-8B上,SpyRL在GovReport等五个摘要数据集取得最高ROUGE-L,GovReport上Qwen3-4B由30.2升至36.7;创意写作总体胜率最高达81.3%;数学推理七项基准平均提升8.97个百分点,AIME 2025上Qwen3-4B由6.7升至20.0。该方法无需人工标注或外部裁判。
8、Physical AI正进入经验工程时代,Ropedia聚焦全链路数据基建,完成数千万美元融资
Physical AI公司Ropedia宣布完成新一轮数千万美元融资,由多家东南亚头部风投领投,一线美元基金及智能制造、大模型产业方参投。其旗舰数据集Xperience-10M在Hugging Face全平台数据集榜位列第2名、具身赛道第一,累计下载超270万次,已被Qwen-VLA、MolmoMotion、ACE-Ego-0等模型采用。公司已服务超20家全球机器人及基础模型公司,计划于2026年8月发布新一代多模态采集系统。
9、反击VLA中「L」无用论:用对位置指令泛化能力暴涨20-40%
上海交通大学与无界动力具身智能实验室联合提出GSR(Grounded Semantic Re-Binding)方法,以提升VLA模型的指令泛化能力。研究发现现有模型在改写指令后成功率大幅下降,如SmolVLA从72.0%降至4.47%,VLA-Adapter从98.2%降至46.82%。GSR通过调整语言语义进入视觉与动作计算路径的方式,在LIBERO-Para等基准上使指令泛化成功率提升20%-40%,并识别出语言信息在特定层集中控制动作,单层替换可恢复96.8%的动作差异。相关模型包括VLA-Adapter、SmolVLA和π0.5。
上一篇
【紧急加更】谷歌Bard中文版火爆上架,畅享中文对话,一键登录,告别ChatGPT封号困扰!
下一篇
08月05日AI资讯 | Ilya首个模型将上线;Sand.ai开源千亿MoE视频模型;SpaceX英伟达AI算力上天;阿里发布Qwen3.8
- 作者:AI学长小林
- 链接:https://ai.linbintalk.com//article/3b4629a6-152d-814d-897a-da2453acfa5b
- 声明:本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

