XTalking · Daily · AI × Automotive

小谈AI智舱

The Daily Brief on AI and Automotive
TUE 2026-08-11 精选 12 条 Vol. 223
01 今日头条 TOP STORIES
1
工程实践

Claude Code 5 天后默认自动模式 · 超支 Anthropic 兜底

Anthropic 官宣 5 天后 Claude Code 默认开启"自动模式"(Auto),会话越长模型会主动切换到更便宜的档位,超出的算力成本由 A 社自己承担。官方给的理由很直白:长会话里人的表现会下降,让模型自己判断上下文预算,反而更稳。这次改动配合了 Sonnet / Haiku 之间的动态路由,单次任务里可以自动降级。对天天用 Claude Code 跑测试脚本、写自动化用例的同学,直接意味着长时间跑 Agent 的钱包压力小了一截,不用再手动切模型档位。

这是继上月 Skills GA 之后 Anthropic 又一次把"用起来别肉疼"当成产品卖点,和 Cursor / Cline 按 token 明码标价的路子完全反过来。建议这两天把手上跑得比较久的 Agent 脚本(比如批量 case 生成、日志分析)重新跑一次,对比一下 5 天后的账单差异,顺手把默认 profile 从 Opus 挪到 Auto。

2
智能汽车

自动驾驶五年定型:L3"孤岛" vs L4"桥",算力先出答案

车东西的一篇长文把过去 5 年智驾路线拉了张全景图:走 L3 单车智能"孤岛路线",还是走 L4 车路云一体"桥路线",算力配置差异是最直接的分水岭。当前主流量产平台大都卡在 254~508 TOPS(Orin-X 单/双)区间,而 L4 目标平台已经在瞄准 1000~2000 TOPS 起步,芯片选型倒推路线基本板上钉钉。文中把小鹏 XNGP / 华为 ADS / Momenta / Waymo 分别对应到两条路径。对做测试的读者,这决定了未来 3 年测试台架要不要额外准备大算力域控和车路云 V2X 联调环境。

这是继去年"端到端一战"之后第二个方向性话题,和上半年地平线征程 6P、英伟达 Thor 相继放量的时间点高度重合。建议把 L3/L4 两套典型算力预算(400 TOPS vs 1500 TOPS)对应的性能基线整理一版,特别是内存带宽、AI 芯片供电时的座舱侧掉帧表现,提前压一压边界。

3
AI 大厂动态

Meta 发布 Muse Glimmer · 30B 参数为常驻端侧 Agent 而生

Meta 开源了 Muse Glimmer,一款 30B 参数、专为"always-on 本地 Agent"优化的模型,HN 冲到 993 分。它的目标不是刷榜,而是让模型能长期驻留在设备上处理连续任务 —— 上下文压缩、工具调用延时、内存足迹都做过针对性优化。相比 Llama 4 走的通用路线,Glimmer 更像是给 Agent 场景量身裁的一件外套。对做车机的读者,这类"能常驻、能调工具、不用一直连云"的模型,才是未来座舱本地 Agent 的现实底座 —— 比动辄 70B+ 的大模型对内存和功耗友好得多。

这是 Meta 继 Llama 4 之后第一次专门为端侧 Agent 出模型,和 Google Gemini Nano、Apple Foundation Model 走的都是同一个赛道。建议在 8295 或 Thor 座舱平台上先跑一版 int4/int8 量化版,重点看首 token 延迟和长会话下的内存膨胀曲线,这两个指标才是端侧 Agent 上车的真正门槛。

02 智能汽车 AUTOMOTIVE
座舱 / 端侧模型
  • Om AI 端侧 3B VLX 模型 · 号称碾压英伟达谷歌 Om AI 发布 3B 参数原生 VLX 模型,主打端侧物理世界感知,声称在若干视觉基准上超过英伟达、谷歌的同类小模型。3B 这个体量刚好适配 8295 甚至 8155 上车,做多模态语音 + 视觉融合。对座舱测试同行,意味着接下来"多模态本地推理"会陆续进入量产 case,建议留意其 int8 版本在 8295 上的 token/s 和内存占用,把它加入座舱 AI 性能基线里。 → 原文
车企动向
  • 尊界最贵国产 MPV 上市 · 顶配 117 万 · 余承东:跨代领先 华为鸿蒙智行体系的尊界 MPV 正式上市,顶配定到 117 万元,直接对标埃尔法/库里南级别,搭载最新一代 ADS 与鸿蒙座舱。这是继问界 M9、享界 S9 之后华为把"高端"往上顶的又一步,也是国产 MPV 首次进入百万区间。对做座舱测试的同行,值得关注这一代鸿蒙座舱在多屏协同、后排娱乐、影音下沉时的性能表现,基本代表国内座舱能做到的天花板,可以作为对比标杆。 → 原文
03 工程与研究 ENGINEERING & RESEARCH
AI 大厂动态
  • OpenAI 推出 GPT-5.6-Cyber · 网络安全专用模型 OpenAI 通过 Daybreak Red 计划发布 GPT-5.6-Cyber,面向授权的漏洞研究、exploit 验证和安全测试场景,只对通过资质审核的红队/安全公司开放。这是继 GPT-5.6 主线之后 OpenAI 第一次把"专用模型 + 白名单准入"作为产品形态。对做车机安全测试的读者,意味着后续车企在做整车渗透测试时,大概率会引入这类专用 LLM 辅助漏扫,建议关注它在固件反汇编、CAN/以太网协议 fuzz 场景下的实际能力。 → 原文
工程实践
  • Docker Sandboxes 发布 · 给 AI Agent 的一次性隔离环境 Docker 正式推出 Sandboxes 产品,专门为 AI Agent 提供一次性、隔离的执行环境,HN 冲到 622 分。相比开发者手搓 docker run --rm,它内置了资源上限、网络策略和快速销毁,一个 Agent 想执行代码就起一个 sandbox。这解决了 Claude Code / Codex 类 Agent 常见的"跑野代码没兜底"问题。对做自动化测试的同行,可以直接用它跑 Agent 生成的测试脚本,不用担心污染宿主机,建议试着把它接到日常的 CI 流水线里。 → 原文
  • Claude / GPT 知识截止日期研究 · 训练时间线被逆向出来 一位独立研究员通过 prompt 探针,把 Claude 和 GPT 各版本的实际知识截止时间、可能的预训练窗口逐个还原,HN 92 分。研究发现官方声称的 cutoff 和模型实际"记得"的最晚事件之间常有 2~4 个月偏差。对做 Agent 应用的读者,这直接影响 RAG 的策略 —— 你以为模型知道的东西,它可能其实不知道。建议在 Prompt 里显式声明"当前日期",别指望模型自己判断时效。 → 原文
硬件与芯片
  • Cactus Needle2 发布 · 14MB Agentic LLM 塞进手表和机器人 Cactus Compute 开源 Needle2,一款仅 14MB 的 agentic LLM,目标是手机、可穿戴、智能家居和机器人这些极端受限设备。14MB 的量级意味着连 MCU 都能塞,和 30B 的 Muse Glimmer 是端侧的两个极端。对做座舱的读者,Needle2 更适合做仪表、HUD、方向盘按键这些"次级屏"上的极简 Agent,比如离线语义命令识别。建议对比它和目前 KWS + 意图分类小模型的召回率差异。 → 原文
  • 安谋科技三业务线交卷 · All in AI 冲刺智能体基建 安谋科技(Arm 中国)对外披露 CPU、GPU、NPU 三条业务线的进展,主打"智能体时代 AI 基建底座",重点强化了 NPU 侧对大模型端侧推理的支持。这是继高通 8295、地平线征程 6 之后,国产化侧对座舱 AI 算力的又一次卡位。对车机测试同行,意味着未来国产座舱 SoC 会陆续用上安谋这套 IP,建议提前关注其 NPU 在 int4 量化和 KV Cache 优化上的表现,过去围绕 Adreno / Mali 的性能基线可能需要新增一列。 → 原文
行业观察
  • 模型路线趋同后 · Physical AI 胜负手转向数据与仿真 量子位一篇长文指出,在 VLA / 世界模型的架构逐渐收敛后,Physical AI(具身+自动驾驶)的瓶颈从"模型创新"转向"高质量物理交互数据 + 高保真仿真"。这和自动驾驶领域从"卷算法"到"卷数据闭环"的迁移几乎一致。对做智驾/座舱测试的读者,这意味着未来仿真场景生成能力将直接影响模型验证质量,建议关注 NVIDIA Omniverse、Waymax 这类平台在国内的对应替代方案。 → 原文
  • 美国药店 Kinney Drugs 撤下 AI 电话助手 · 数百投诉 美国连锁药店 Kinney Drugs 在收到数百起客户投诉后,回撤了刚上线不久的 AI 电话助手,HN 139 分讨论热烈。问题主要集中在处方识别错误、医患信息漏传、以及无法转人工。这是继美航空客服 AI 翻车之后又一起典型的"上得太快"事故。对做车机语音/AI 助手的读者,值得引以为鉴 —— 车内场景比电话更复杂,建议在稳定性测试里专门加一组"AI 卡壳时能否 fallback 到传统语音/物理按键"的用例。 → 原文