XTalking · Daily · AI × Automotive

小谈AI智舱

The Daily Brief on AI and Automotive
SUN 2026-08-23 精选 12 条 Vol. 235
01 今日头条 TOP STORIES
1
工程实践

MCP 官方公布新版路线图 · 认证与注册中心成重点

Model Context Protocol 官方博客发布了新一轮 roadmap,HN 上冲到 170 分 123 条评论。重点方向包括:统一的 Server Registry(避免大家各自维护 mcp.json)、更严格的 Auth 规范(OAuth 2.1 + 细粒度 scope)、以及 Server 的异步/长任务支持。对做车机的读者来说 MCP 已经不只是 Claude 的私有协议 —— OpenAI · Google · JetBrains 都在跟进,意味着未来把车端诊断工具 / 日志系统 / 测试脚本包装成 MCP Server,可以直接被各家 Agent 消费。

上一版 roadmap 主要解决 stdio → HTTP 迁移,这版明显是往"生态基础设施"走,和 npm/PyPI 一样要有中心化注册和签名。建议现在就把手上一个高频测试脚本(比如"跑一遍冷启动 10 次并输出报告")包成最小 MCP Server 练手,是当下 ROI 最高的技能投资。

2
AI 大厂动态

Claude Code 疑似被 A/B 测试"降智" · 用户实测响应变懒

Twitter 用户 @argofowl 抓到 Anthropic 在 Claude Code 里悄悄做 A/B 测试,把部分账号的推理 effort 调低了 —— HN 讨论 157 分 149 楼,大量开发者反馈同样 prompt 突然只跑一半、跳过验证步骤、直接给"看起来能编译"的代码。Anthropic 尚未公开确认,但从行为上看这是继"context 压缩"之后又一次算力成本控制。对每天靠 Claude Code 跑活的读者,意味着近期若感觉"它变笨了"不是错觉,建议明确写出"run tests · fix until green"这类强约束 prompt 兜底。

这不是第一次 —— 去年 GPT-4 也被 Reddit 集体投诉过"降智",最后 OpenAI 才承认路由到了更小的模型。趋势很清楚:模型服务方会不断在成本和质量间做隐性权衡。建议本地留一份自己的 benchmark(3-5 个高难度真实任务),每周跑一次记录,别等到线上出事才怀疑供应商。

3
智能汽车

华为尚界"方盒子"42.98 万起 · 余承东预告数月内推 L3

华为鸿蒙智行旗下首款"方盒子"硬派 SUV 正式上市,起售价 42.98 万,车顶帐篷作为选装首发,余承东在发布会上明确表态"再有几个月就能用上 L3"。这是华为 ADS 4 之后首次给出明确的 L3 商用时间点 · 意味着从"高阶智驾辅助"跨到"责任转移"只差临门一脚。对车机测试同行,L3 落地会带来一整套新的 HMI 交互和降级策略测试项 —— 比如接管请求(TOR)的最小响应窗、仪表 / HUD / 座椅震动的多模态告警一致性,这些用例过去在 L2 里可以"意思意思",L3 是要过法规的。

对比奔驰 Drive Pilot 在美德的 L3(限速 95km/h · 仅限特定路段),华为如果真能落地更大范围 ODD,场景复杂度会高一个量级。建议现在就把 UN-R157 和 GB/T 40429 两份文档过一遍,尤其"人机共驾切换"这一章 —— 未来一年这会是座舱测试组的核心 KPI。

02 智能汽车 AUTOMOTIVE
车企动向
  • 吉利交出最好半年报 · 李书福交棒 · 终结燃油车研发 吉利汽车公布上半年营收创历史新高,李书福正式交棒新一代管理层,同时宣布不再投入新的燃油车研发资源,全面聚焦电动化+智能化。对比大众今年才刚砍掉部分燃油车项目,吉利这次是把"停止研发"直接摆到台面上。对做座舱的同行意味着未来吉利系(极氪 / 领克 / 银河)的车机迭代节奏只会更快,基线可能每半年就要重新对齐。建议关注极氪 OS 的下一版更新节奏,可能会是全集团的技术底座。 → 原文
出行
  • 小马智行海外部署超 4000 辆 · Robotaxi 出海闭环成形 小马智行公布海外(中东 / 东南亚 / 欧洲)累计部署超过 4000 辆 Robotaxi,已跑通"车队投放 + 本地运维 + 保险合规"完整闭环。对比 Waymo 目前主要还在美国本土扩,Cruise 收缩,小马属于中国 Robotaxi 玩家里出海最激进的一家。这类海外场景对车端联网、地图、语音多语种、法规差异化的测试要求都比国内高一个档次。建议关注他们的多语种语音交互方案,是国内 IVI 出海最直接的参考样本。 → 原文
03 工程与研究 ENGINEERING & RESEARCH
工程实践
  • Latent Space:Agent Harness 正在被模型"吞掉" Swyx 的新文章提出一个观察:过去一年大家搭的各种 agent harness(ReAct 循环 / 工具调用调度 / 记忆管理)正在被下一代模型直接吸进权重里,最终外壳会变成"人类注意力的 harness"而不是"模型的 harness"。对比一年前 LangChain 那套 chain 结构,现在 Claude / GPT 内部自己就会规划工具调用。对做测试的同行:未来评估重点不再是"框架接得对不对",而是"模型自身规划能力对不对"。建议少花时间在 orchestration 上,多把精力放到 eval set 建设。 → 原文
  • Simon Willison:用好 coding agent 的关键是"敢下指令+敢验证" Simon 在博客里总结用好 Claude Code / Cursor 这类工具的核心技能:自信地给出精确指令,再自信地验证结果 —— 不是每次都逐行审代码,而是有明确的验证手段(测试 / 截图 / 手动跑一遍)。对比很多人还停留在"看代码看不完就放弃"的状态,他强调 code review 只是验证方式之一。对车机测试岗天然契合 —— 我们本来就习惯"跑用例验证"。建议把日常测试脚本改造成"给 agent 写 + 自己跑用例验收"的工作流,复用现有测试技能。 → 原文
  • 为什么你的本地 LLM 感觉比实际更"笨" Level1Techs 论坛一篇长文 HN 讨论 152 分,拆解本地 LLM 常见"变笨"原因:量化过度(Q4 以下)、context window 被 llama.cpp 默认截到 2K、采样参数(temperature/top-p)没调、chat template 用错。作者给出对照实验数据:同一个 Qwen2.5-32B 换正确 template 后基准分能差 15%。对车企要做本地车端小模型的同行是必读 —— 座舱侧塞 3B/7B 模型时这些坑一个都逃不掉。建议把文中的 checklist 直接抄进车端模型部署验收流程。 → 原文
AI 大厂动态
  • 智东西实测 DeepSeek Harness · 梁文锋的"黑鲸鱼"有惊喜 DeepSeek 悄悄放出的 agent harness(内部代号"黑鲸鱼")被智东西上手实测,重点在于把 R1 系列的长推理链和工具调用做了原生编排,不用外挂框架就能跑多步任务。对比 Anthropic 的 Skills 和 OpenAI 的 Responses API,DeepSeek 走的是"模型自带 harness"路线,和上面 Latent Space 那篇观察方向完全一致。对国内做车端 AI 的同行,DeepSeek 端云一体成本优势明显。建议下周花两小时跑通它的 harness API,和 Claude Code 做个横评。 → 原文
硬件与芯片
  • No Starch 新书《Embedded AI》· 讲把模型塞进 MCU 的工程细节 No Starch Press 出的新书《Embedded AI》聚焦 TinyML 到边缘 SoC 部署,覆盖模型量化、算子融合、内存布局、功耗预算全链路,HN 上有 33 分讨论。对比市面上大多数偏"云端 LLM"的书籍,这本明确瞄准嵌入式场景。对车机同行价值直接 —— 座舱域控里的语音唤醒、驾驶员监控 DMS、疲劳检测都是典型的 embedded AI 负载。建议采购一本放工位,尤其量化和功耗那两章,可以作为 8295 上跑本地小模型时的性能调优参考。 → 原文
行业观察
  • 优必选把客户产线 1:1 搬进 WRC · 具身智能真落地 优必选在 WRC 世界机器人大会上没做 Demo · 直接把汽车客户的产线 1:1 搬到现场,同一个"大脑"(端侧部署)复用到工业 / 商用 / 家庭三类机器人本体,展示的是快速适配能力。对比大多数具身智能公司还在"抓个方块"阶段,把整条产线搬到会场是相当激进的表态。对做座舱的同行有间接启发 —— 汽车厂前装线的机器人一旦具身化,车机的 OTA / 诊断链路可能会和产线机器人共用一套 MCP 或类似协议。建议看看优必选和车企的合作名单,可能会有意外发现。 → 原文
  • Latent Space:差 10% · 便宜 100 倍 · 快 10000 倍 —— Simulation 正在接管 Swyx 的另一篇专栏指出一个正在发生的转变:很多任务用仿真+小模型替代真实环境+大模型,只损失 10% 效果但成本降 100 倍、速度快 10000 倍,已经在训练数据合成 / RL 环境 / eval 场景全面铺开。对比过去 RSI(递归自我改进)只发生在模型训练阶段,现在推理和评测环节也开始"仿真化"。对智驾和座舱测试的同行意义直接 —— 场景库仿真早就是主流,但用"AI + 仿真"生成海量长尾用例还是新方向。建议关注 NVIDIA Cosmos 和 Waymo Simulator 的最新论文,能直接借用到车机稳定性测试。 → 原文