OpenAI首颗芯片Jalapeño亮相,性能比肩Blackwell

在第37届Hot Chips大会上,OpenAI发布了其首款定制推理芯片Jalapeño的基准测试数据。测试显示,Jalapeño在性能功耗比和端到端延迟上均显著优于NVIDIA GB200/GB300系统,标志着前沿AI实验室在推理硬件上开始摆脱对NVIDIA的绝对依赖。同时,大会还涵盖了本地Agent、检索基础设施和机器人数据集等多个热点方向。

导语

在近期举办的第37届Hot Chips大会上,OpenAI投下了一颗重磅炸弹:详细公布了其首款定制推理芯片Jalapeño的基准测试结果。这距离其宣布与Broadcom合作开发芯片不到一年。OpenAI宣称,Jalapeño并非简单的ASIC,而是一款在能效和延迟上全面超越NVIDIA Blackwell架构的全新解决方案。这一消息不仅引发了关于AI推理硬件格局巨变的讨论,也预示着前沿AI实验室正从单纯的模型训练竞争,延伸至底层硬件栈的垂直整合与优化。

大纲与深读 7 章

展开「深读」看每一段讨论的问题与论据。

01

OpenAI发布自研芯片Jalapeño

  • OpenAI发布自研推理芯片Jalapeño,性能超越NVIDIA GB200/GB300系统
  • Jalapeño在峰值吞吐量下实现1.5–1.9倍能效提升,端到端延迟降低1.7–3.6倍
  • 芯片额定功率700W,实测运行时功耗控制在550W以下
  • OpenAI计划年底前将芯片部署到自有基础设施,第二代芯片已在开发中
深读这一段

讨论的问题:OpenAI自研芯片Jalapeño的技术突破和部署计划是什么?

论据 / 案例:Jalapeño实测数据显示1.5–1.9倍能效提升,延迟降低1.7–3.6倍,功耗控制在550W以下;部署计划年底开始,Gen 2已在开发,Gen 3在规划中。

02

AI模型辅助芯片优化

02:00
  • GPT-Astra + Codex帮助编写和优化Jalapeño的底层内核
  • AI辅助的内核实现比人类专家编写的代码快1.5–1.8倍
  • 编译器/内核工作正被纳入模型改进循环,不仅限于应用层编码
  • 这一进展表明模型辅助的系统优化成为新趋势
深读这一段

讨论的问题:AI模型如何协助芯片底层优化?这对行业意味着什么?

论据 / 案例:GPT-Astra + Codex在约两个月内将三个未计划的开源模型优化至Jalapeño高性能,注意力和MoE块运行速度提升1.5–1.8倍。

03

AI Agent系统工程成熟化

03:00
  • Microsoft的AutoSaddler论文将Agent框架作为代码处理,离线修补提示词和工具配置
  • 研究发现更换框架对性能的影响大于更换模型
  • SWE Refactor Bench测试表明长距离软件工程任务仍极具挑战性
  • 记忆系统从压缩聊天历史转向可编程状态,使用追加事件日志和持久化Python内核
深读这一段

讨论的问题:当前AI Agent系统面临哪些关键工程挑战?

论据 / 案例:AutoSaddler在GAIA2上提升9.0分,SWE-Bench Pro提升9.6分;SWE Refactor Bench测试中仅5.4%任务能完成全部三个阶段。

04

本地优先Agent产品发布

05:00
  • Perplexity在NVIDIA DGX Spark上推出Portable Computer,实现完全本地运行的Agent
  • 本地堆栈使用PPLX 27B模型,Qwen 3.8 27B也可用
  • Apple通过M5 Ultra Mac Studio和M6/M5 Pro Mac Mini推进本地AI工具
  • exo框架强调Thunderbolt 5的低延迟RDMA,4台M5 Ultra可聚合约4.8 TB/s内存带宽
深读这一段

讨论的问题:本地优先AI Agent产品如何实现无云依赖的运行?

论据 / 案例:Perplexity Portable Computer在NVIDIA DGX Spark上运行,包含本地LLM编排器、子代理和Agent框架;exo框架在4台M5 Ultra上实现4.8 TB/s聚合内存带宽。

05

模型与检索基础设施进展

07:00
  • Qwen 3.8模型在部署和评估中表现突出,Together提供微调和推理支持
  • Qwen3.8-27B在Image-to-WebDev Arena达到开源模型第一、总排名第七
  • Hugging Face详细介绍了Papers with Code搜索引擎架构:PostgreSQL + pgvector
  • Keenable以2600万美元种子轮融资推出面向Agent规模的Web搜索API
深读这一段

讨论的问题:当前AI模型和检索基础设施有哪些重要进展?

论据 / 案例:Qwen3.8-27B定价为0.40/3美元每百万输入/输出token;Hugging Face搜索堆栈使用Qwen 3 Embedding 0.6B模型和NVIDIA L4生成嵌入。

06

机器人数据集与物理建模

09:00
  • Figure推出Index,号称全球最大最多样的机器人数据集,已支付1500万美元数据费用
  • Index数据集处理速度达每秒30分钟视频上传,已有1600万视频上传和26.4万次下载
  • Figure计划未来12个月在数据和计算上投入10亿美元
  • Anima Anandkumar的Accelerated Understanding声称预训练时达1T参数、推理时达5T上下文
深读这一段

讨论的问题:机器人数据和物理世界建模领域有哪些突破性进展?

论据 / 案例:Figure Index数据集支付1500万美元,计划投入10亿美元;Accelerated Understanding声称预训练1T参数、推理时5T上下文。

07

行业讨论热点总结

10:50
  • OpenAI芯片发布成为最大技术讨论话题,Sam Altman的推文获得极高互动
  • Perplexity的Portable Computer成为芯片故事外最大的产品发布
  • OpenAI推出WebMCP Challenge,推动网站向显式Agent接口发展
  • Andrew Ng的OpenWorker项目结合开源框架、本地模型和安全工作流
深读这一段

讨论的问题:本次Hot Chips会议期间哪些话题引发了最广泛的行业讨论?

论据 / 案例:OpenAI芯片推文获得226万浏览;Perplexity产品发布是芯片故事外最大亮点;WebMCP Challenge推动Agent化网页发展。

金句

  • "The key metric now is shifting to performance per watt, and Jalapeno delivers." ——现在的关键指标正转向每瓦特性能,而Jalapeño做到了。
  • "Jalapeño delivered 1.5–1.9× more work per watt at peak throughput and 1.7–3.6× lower end-to-end latency." ——在峰值吞吐量下,Jalapeño每瓦特完成了1.5到1.9倍的工作,端到端延迟降低了1.7到3.6倍。
  • "GPT-Astra + Codex helped write and optimize low-level kernels, bringing three previously unplanned open-weight models to high performance on Jalapeño in about two months." ——GPT-Astra + Codex帮助编写和优化了底层内核,在大约两个月内将三个原本未计划的开源权重模型在Jalapeño上提升至高性能。

原文链接

查看完整访谈

完整内容见原文:Latent Space · OpenAI首颗芯片Jalapeño亮相,性能比肩Blackwell