XTalking · Daily · AI × Automotive

小谈AI智舱

The Daily Brief on AI and Automotive
SUN 2026-08-16 精选 12 条 Vol. 228
01 今日头条 TOP STORIES
1
AI 大厂动态

DeepSeek 放出 Harness · 梁文锋的"黑色鲸鱼"落地

DeepSeek 官方开源了自家的 Agent Harness(内部代号"黑色鲸鱼"),把此前只在论文里出现的推理调度层完整开放。Harness 内置了工具循环、上下文压缩、并行 branch 三大能力,官方跑分显示同一 base 模型接入 Harness 后,SWE-bench Verified 从 52% 直接抬到 68%。对做 AI 工程的读者来说,这是一次相当务实的下沉 —— 你不用再自己拼 ReAct、self-critique、memory pruning,一套 CLI 起手就能跑通,直接省掉 2-3 周的胶水代码工作。

对标 Anthropic 的 Claude Code、Cognition 的 Devin harness,这次 DeepSeek 是首个把完整 harness 开源出来的头部厂商,而不是仅放模型权重。建议本周先用 Harness + DeepSeek-V3.2 在本地跑一遍 SWE-bench 复现,重点看它的 sub-agent 分派逻辑,能对后面自己写 Agent 框架提供最好的抄作业样本。

2
智能汽车

郎咸朋二次创业 · 把"百万智驾量产"复用到机器人

前理想智驾负责人郎咸朋接受量子位 1.9 万字长访谈,首次系统讲他离职后的机器人创业方向。他把理想 AD Max 的三段式数据闭环(采集/标注/仿真回灌)整套搬到机器人上,核心判断是:机器人比智驾差的不是模型,而是"量产级数据管线"。对做座舱/智驾测试的同行,这是一次相当罕见的从量产一号位视角看 VLA 落地的实录,里面对 corner case 治理、场景库建设的经验都能直接迁移到车端评测流程里。

这也是继余凯(地平线)、王劲(景驰)之后,又一位智驾一号位跨行做机器人,大方向和 Figure、1X 主打的端到端 VLA 一致,但走的是"先解决场景数据"的中式路线。建议把这篇 1.9 万字全文实录当周末深度阅读材料,重点读第 3 部分"数据飞轮怎么在机器人上跑起来" —— 对理解未来座舱 Agent 的进化路径也有帮助。

3
智能汽车

7 位车企高管炮轰"速成车" · 工信部四记重拳落地

吉利、长安、广汽、比亚迪等 7 位高管公开批评当下"18 个月一台新车"的速成车乱象,直言"消费者不能变成试车员"。工信部随即出台四项新规,重点包括:整车交付前必须完成不少于 30 万公里道路验证、OTA 涉及功能安全需备案审批、召回责任前置到项目立项阶段。对车机测试工程师来说,这是最直接的政策红利 —— 稳定性测试和 OTA 回归测试的话语权、周期、预算都会同步抬升,不再是被压到最后被砍的那一环。

背景是过去两年小米 SU7、极越、问界等新车密集出现车机死机、OTA 变砖、智驾误动作,舆情多次翻车。建议本周就把自己所在项目的测试周期、覆盖场景、OTA 灰度策略对齐工信部四项新规重新梳理一遍,尤其是 OTA 备案 checklist 值得提前准备 —— 这可能是明年绩效考核的加分项。

02 智能汽车 AUTOMOTIVE
车企动向
  • 尊界 S900 顶配 117 万上市 · 余承东称"跨代领先" 华为鸿蒙智行旗下尊界 S900 正式上市,顶配 117 万,座舱首发 HarmonyOS 5.0 车机 + 三联屏 + 后排 32 寸吸顶大屏,底盘用了华为途灵魔毯 2.0 + CDC + 后轮转向。价位直接对标迈巴赫 S480 / 库里南,是国产 MPV 目前的天花板。对座舱测试同行,意味着又一个必须纳入 benchmark 的 HarmonyOS 车机新版本,建议提前拿到测试台架跑一轮多屏协同、语音多音区、鸿蒙分布式流转的性能基线。 → 车东西
  • 上半年车市变天 · 长城奇瑞被理想小鹏反超 车东西梳理 1-7 月国内销量,长城本土同比 -18%、奇瑞 -12%,均被理想、小鹏在纯电+插混合计口径上反超,长城奇瑞主要靠出海撑住整体大盘。核心原因是纯电+智能化产品线迭代慢,15-25 万主力价位段被新势力压得抬不起头。对测试同行,意味着未来一年测试机型的重心会更向新势力倾斜,老牌车企的多品牌矩阵测试资源可能面临收缩 —— 提前想清楚自己的技术栈往哪个平台押注。 → 车东西
03 工程与研究 ENGINEERING & RESEARCH
AI 大厂动态
  • Qwen3.8-27B 开源 · 消费级显卡跑出"Opus 级"Agent 阿里通义放出 Qwen3.8-27B,4bit 量化后 24GB 显存即可跑通 Agent 工作流,在 GAIA、SWE-bench、TerminalBench 多项榜单超过 Claude Opus 4。亮点是"推理档位"可自定义 —— 从 fast 到 deep 五档切换,类似 GPT-5 的思考预算控制。对做本地化车端 AI / 私有部署的团队,这是目前性价比最高的开源选项,建议先在 4090 或 5090 上跑通,评估能否作为下一代车端 Agent 的备胎方案。 → 量子位
  • Sand.ai 开源千亿级 MoE 视频模型 · 首个视频 Scaling 尝试 Sand.ai 放出全球首个百亿激活、千亿总参的 MoE 视频生成模型,把 LLM 上验证过的 Scaling Law 首次搬到视频域,4 秒 720p 生成成本比同尺寸 Dense 模型降 60%。同类的 Sora 2、可灵 2.0 都还是 Dense 架构,MoE 是绕开视频算力墙的新路径。对座舱测试同行,短期看是给车机 UI 预告片、AI 壁纸生成多了一个成本更低的引擎,值得关注它后续的 API 定价。 → 智东西
  • Anthropic 公布 Claude 水印技术细节 Anthropic 首次披露 Claude 内容水印方案:在 token 采样层嵌入统计不可察觉的信号,官方声称即使经过复述、翻译、截断仍可 95% 检出,且不影响写作质量。对比 OpenAI 此前搁置的水印方案,Anthropic 是首个正式落地的头部厂商。对做车机 Agent 的团队,意味着车内 AI 生成内容(语音播报文本、聊天回复)未来可能会被自动打标,建议关注 API 是否提供开关,以及对合规审计的影响。 → TechCrunch
工程实践
  • Astro 作者做 Flue 2 · 用 React Hooks 的思路写 Agent Astro 框架作者 Fred Schott 推出 meta-harness 框架 Flue 2,把 React 的 hooks 模型引入 Agent 编排 —— useMemory、useTool、useContext 一套组合式 API 定义 Agent 生命周期。他在 Latent Space 播客里的核心观点是:"Agent 的能力上限由 harness 决定,不是模型。"这跟 DeepSeek Harness 的思路高度一致。对做 Agent 工程的读者,建议花两小时读 Flue 2 文档,即使不用它,hooks 化的 Agent 设计模式本身就值得抄。 → Latent Space
  • HN 254 赞热帖:与 AI 协作更像做管理 · 不再是写代码 Hacker News 一篇 254 赞的博客引发讨论,作者认为长期用 Claude Code / Cursor 后,自己的工作模式从"写代码"变成了"任务分派 + 结果 review + 边界纠偏",本质上是带一支 AI 小分队。对比一年前"AI 只能补全一行"的时代,现在的 pain point 已经变成了如何拆任务、如何验收、如何在幻觉出现时快速刹车。对测试同行,这个视角其实非常适合迁移到 AI 辅助测试用例生成的日常协作里,值得反思自己的工作流是不是还停留在"打字员"阶段。 → HN
学术前沿
  • Dual-Flow Transformers · 把 Prefill 和 Decode 硬件解耦 arXiv 新论文提出 Dual-Flow Transformer 架构,把 prefill(计算密集、并行)和 decode(访存密集、串行)彻底拆成两条独立计算路径,可分别部署在计算卡和访存卡上。作者报告在长上下文场景下 TCO 降 35%,吞吐提升 2.1×。对车端来说,座舱 Agent 的长上下文 + 流式解码就是典型 dual-flow 场景,值得关注这个架构未来会不会被移植到车端 NPU 的 kernel 优化里。 → arXiv
  • 至知研究院:拆权重做可解释性 · 数据成本降到 1% 至知研究院提出新的大模型可解释性路线,不再训练替代网络(如 sparse autoencoder),而是直接对原模型权重做结构化分解,声称数据成本不到主流 SAE 方案的 1%。对比 Anthropic、DeepMind 的 SAE 路线动辄要几十亿 token 训练数据,这条路线更适合中小厂复现。对车端 Agent 团队,意义在于未来做车内 AI 的"可解释性合规审查"时,门槛可能大幅下降 —— 建议持续关注该团队后续开源计划。 → 量子位