XTalking · Daily · AI × Automotive

小谈AI智舱

The Daily Brief on AI and Automotive
SAT 2026-08-22 精选 12 条 Vol. 234
01 今日头条 TOP STORIES
1
AI 大厂动态

DeepSeek Harness 实测:梁文锋憋的"黑色鲸鱼"到底怎么样

DeepSeek 悄悄放出了自家的 agent harness —— 也就是把模型、工具调用、记忆、多轮规划打包成一套可以直接落地的执行框架,智东西第一时间做了实测。这次的重点不在模型本身,而在"外壳":同样的 DeepSeek-V3 底座,套上官方 Harness 后,复杂任务(浏览器操作、代码修 bug、多步 API 编排)的完成率明显高于裸调用,而且推理成本没有明显上涨。对做工程的读者来说,这意味着国产开源侧终于有一套可以对标 Claude Code / Codex 的"官方最佳实践",不用再自己拼装 ReAct + Function Calling 那一套。

这一步和 Anthropic 把 Skills 收进 Claude Code、OpenAI 把 Codex 独立成产品是同一条路径 —— 大家开始承认"harness 才是护城河"。建议花一个周末把 DeepSeek Harness 跑一遍,重点看它的工具调用协议和上下文压缩策略,这些是未来接入车端 Agent 时最直接可复用的部分。

2
行业观察

Nvidia 站台:真正的主角不是模型,而是 harness

TechCrunch 的这篇观察把最近半年 AI 圈的路线变化说得很直白 —— Nvidia 在最新的开发者活动上强调,今天决定 AI 应用能不能用的,已经不是模型的 benchmark 分数,而是围绕模型搭的那一整套 harness(工具、记忆、评测、路由、成本控制)。这和 DeepSeek 今天发 Harness、Anthropic 主推 Claude Code、OpenAI 独立 Codex 是同一个信号。对车机测试工程师意味着:未来评估一个车端 AI 助手好不好用,不能再只看"用的什么模型",而要看它的 agent 框架、工具接入方式和失败恢复机制。

对比 2024 年"谁模型大谁赢"的叙事,现在整个行业的价值重心正在从 pretraining 向 post-training + harness 迁移。建议开始建立自己的 harness 层评测集 —— 比如"车控指令连续 10 轮不掉链子"、"跨 App 拉起成功率"这种指标,比单纯看语音识别 WER 更能反映真实体验。

3
智能汽车

华为系首款方盒子 42.98 万起 · 余承东预告"几个月上 L3"

华为鸿蒙智行阵营首款方盒子造型 SUV 正式上市,起售价 42.98 万,同时发布了车顶帐篷这种越野向配件。更值得关注的是余承东在发布会上再次口头预告"再有几个月就能用上 L3"——考虑到目前国内 L3 试点法规才刚落地,这句话如果兑现,华为会是首个把 L3 有条件自动驾驶推到量产用户手里的国内品牌。对做智驾/座舱测试的同行意味着:L3 场景下的接管请求、责任切换、HMI 提示这些新测试项要开始准备了。

对比奔驰 Drive Pilot 在德国和加州的 L3 限速 95 km/h、必须前车跟随的严苛条件,华为如果真的量产 L3,大概率也会走"高速 + 限速 + 特定天气"的窄口子先跑起来。建议提前熟悉 UN-R157 和国内《汽车驾驶自动化分级》里对 L3 的 HMI 强制项,这套测试用例迟早会落到测试台上。

02 智能汽车 AUTOMOTIVE
车企动向
  • 吉利半年报创新高 · 李书福交棒 · 将终结燃油车研发 吉利汽车公布上半年最好业绩,同时官宣停止一切新燃油车研发投入,把资源全压到电动+智能化上。这和大众、Stellantis 依然在双线并进不同,吉利选择的是比亚迪式的"一刀切"。对车机测试意味着未来吉利系全新车型(极氪、领克、银河)会更快统一到自研的 Flyme Auto / 银河 OS 上,测试基线可能要重新对齐。建议关注吉利下一代域控和芯片选型,尤其是 Flyme Auto 在多品牌间的差异化配置。 → 原文
  • 9 大车企召回超 700 万辆 · 主因是车内门把手 这次召回横跨 9 家车企、超过 700 万辆,统一指向"车内门把手"这个看似不起眼的部件 —— 涉及碰撞后无法从内部打开的安全隐患。这让电子门把手、隐藏式门把手的可靠性再次被推到风口浪尖,和几个月前特斯拉 Cybertruck 的类似召回是同一条主线。对做座舱测试的同行,提醒电子把手的降级逻辑、断电应急拉手、碰撞后自动解锁这几个场景要作为强制测试项。建议排查现有测试用例是否覆盖"12V 断电 + 碰撞信号"的组合工况。 → 原文
智驾 · 出行
  • 小马智行海外部署超 4000 辆 · 拼出 Robotaxi 出海闭环 小马智行在中东、韩国、卢森堡等多地累计部署超过 4000 辆 Robotaxi,形成从车队运营、本地牌照、到远程支持的完整出海闭环。相比 Waymo 深耕美国本土、百度萝卜快跑主打国内,小马选的是"避开中美主场、专攻政策友好区"的路线。对做智驾测试的同行,意味着未来测试用例要开始覆盖不同法规区的差异 —— 靠左行驶、复杂环岛、宗教节假日路况这些非中国特色场景。建议关注 Pony.ai 公开的 ODD 定义文档,能看出他们如何用工程化方式处理多地域适配。 → 原文
  • 最大运力自动驾驶轻卡量产 · 载重 4.2 吨 / 容积 19.32m³ 国内无人车头部厂商推出行业最大运力的自动驾驶轻卡,单车载重 4.2 吨、货厢容积 19.32m³,目标是城市末端配送和支线物流。和过去 Robotaxi 主打载客不同,这条线的商业化路径明显更清晰 —— B 端付费意愿强、场景相对封闭。对车机测试意味着卡车 HMI 有一套完全不同的评价标准:更少的娱乐、更重的作业调度、和后端 TMS 系统的深度集成。建议关注这类作业型 HMI 的设计范式,和乘用车座舱的差异可能会成为一个新方向。 → 原文
03 工程与研究 ENGINEERING & RESEARCH
工程实践
  • Claude Code v2.1.239 · 新增 --max-budget-usd 成本硬顶 最新版 Claude Code 更新了 /cost、状态栏和 --max-budget-usd 参数,支持给数据驻留 workspace 显示 1.1× 美国本地推理溢价,并且首次在 Bedrock/Vertex/Foundry 上开放全屏渲染器。这是把"agent 花多少钱"从事后账单变成事中可控参数的一小步。对经常跑长任务、跑批量评测的同行来说,--max-budget-usd 可以直接防止 agent 死循环烧掉几十美元。建议把这个参数加进所有自动化脚本的默认模板,当作安全带用。 → 原文
  • 一周深度使用报告:Codex 正在替代 Claude 的位置 开发者 ghinda 记录了自己连续一周主要用 OpenAI Codex 而不是 Claude 的实感 —— Codex 在长上下文重构、跨文件搜索改写上手感更稳,但 Claude 的对话记忆和 Skills 生态依然更完整。HN 上 70 分 80 条评论,是最近少见的第一手对比。对同时用两家工具的读者,这份记录能省你自己踩坑的一周时间。建议至少读一遍评论区,里面有很多具体到"哪个场景用哪个"的实战经验,比软文有价值得多。 → 原文
AI 大厂动态 · 学术前沿
  • Anthropic 把 Claude Mythos 5 的安全能力开放给更多防御方 Anthropic 宣布把最新 Claude Mythos 5 里内置的红队/漏洞发现/威胁情报能力,以专项通道开放给企业蓝队、CERT 和政府防御机构使用。HN 上 42 分 47 条评论,讨论重点在"防御侧能否追上攻击侧的自动化速度"。对做车企安全测试的同行,这套能力未来大概率会渗透到车联网 SOC 和 OTA 供应链审计里。建议关注 Anthropic 公布的合作机构名单和 API 接入方式,以及国内合规替代方案的动向。 → 原文
  • 论文:Edge RAG 的运行时自适应压缩 · 直击 KV-cache 瓶颈 arXiv 新论文提出一套面向边缘设备的 RAG 自适应压缩方案,核心思路是根据 runtime 的 latency/memory 预算,动态决定检索段的压缩率,把 prefill 开销和 KV-cache footprint 都压下来。这是把云端 RAG 直接搬到车端最大的两个拦路虎。对做车机 AI 测试的同行来说,这类工作直接关系到"车端小模型 + 本地知识库"的可行性 —— 未来智能座舱要做本地 RAG,这条路避不开。建议把这篇当作模板,追踪一下同一作者组的后续工作。 → 原文
  • Jeff Dean 离职后首次公开访谈 · 火力全开谈小团队 Jeff Dean 离开谷歌后的首次公开访谈里明确表态:离开的原因之一是"小团队能实现极致聚焦",并对当下 AI 大厂的组织效率提出了不少直接批评。这和最近 Ilya、Karpathy 出走后陆续表达的观点非常一致 —— 顶级研究者集体在用脚投票"小而精"。对做工程的读者,这是一个组织形态的强信号:未来最重要的 AI 突破可能更多来自 20 人级别的团队。建议关注 Jeff Dean 后续的动向,以及他会不会自己搞一个类似 SSI 的小实验室。 → 原文