当前观察 › 来源档案 › OpenAI首颗芯片Jalapeño亮相,性能比肩Blackwell 在第37届Hot Chips大会上,OpenAI发布了其首款定制推理芯片Jalapeño的基准测试数据。测试显示,Jalapeño在性能功耗比和端到端延迟上均显著优于NVIDIA GB200/GB300系统,标志着前沿AI实验室在推理硬件上开始摆脱对NVIDIA的绝对依赖。同时,大会还涵盖了本地Agent、检索基础设施和机器人数据集等多个热点方向。
这份材料帮助我们理解什么? 暂未纳入当前六个问题,保留为研究资料,不代表本站结论。
评论或来源文章 · 来源页面文本 · 已找到对应文本,不代表完整性或事实已经核验
以下保留原有自动整理内容,尚未完成逐句复核;日期与人物沿用档案记录。当前答案和重新核对的依据,请看上方问题页。
导语 在近期举办的第37届Hot Chips大会上,OpenAI投下了一颗重磅炸弹:详细公布了其首款定制推理芯片Jalapeño的基准测试结果。这距离其宣布与Broadcom合作开发芯片不到一年。OpenAI宣称,Jalapeño并非简单的ASIC,而是一款在能效和延迟上全面超越NVIDIA Blackwell架构的全新解决方案。这一消息不仅引发了关于AI推理硬件格局巨变的讨论,也预示着前沿AI实验室正从单纯的模型训练竞争,延伸至底层硬件栈的垂直整合与优化。
大纲与深读 7 章 展开「深读」看每一段讨论的问题与论据。
01
OpenAI发布自研芯片Jalapeño OpenAI发布自研推理芯片Jalapeño,性能超越NVIDIA GB200/GB300系统 Jalapeño在峰值吞吐量下实现1.5–1.9倍能效提升,端到端延迟降低1.7–3.6倍 芯片额定功率700W,实测运行时功耗控制在550W以下 OpenAI计划年底前将芯片部署到自有基础设施,第二代芯片已在开发中 深读这一段 讨论的问题: OpenAI自研芯片Jalapeño的技术突破和部署计划是什么?
论据 / 案例: Jalapeño实测数据显示1.5–1.9倍能效提升,延迟降低1.7–3.6倍,功耗控制在550W以下;部署计划年底开始,Gen 2已在开发,Gen 3在规划中。
02
AI模型辅助芯片优化 02:00 GPT-Astra + Codex帮助编写和优化Jalapeño的底层内核 AI辅助的内核实现比人类专家编写的代码快1.5–1.8倍 编译器/内核工作正被纳入模型改进循环,不仅限于应用层编码 这一进展表明模型辅助的系统优化成为新趋势 深读这一段 讨论的问题: AI模型如何协助芯片底层优化?这对行业意味着什么?
论据 / 案例: GPT-Astra + Codex在约两个月内将三个未计划的开源模型优化至Jalapeño高性能,注意力和MoE块运行速度提升1.5–1.8倍。
03
AI Agent系统工程成熟化 03:00 Microsoft的AutoSaddler论文将Agent框架作为代码处理,离线修补提示词和工具配置 研究发现更换框架对性能的影响大于更换模型 SWE Refactor Bench测试表明长距离软件工程任务仍极具挑战性 记忆系统从压缩聊天历史转向可编程状态,使用追加事件日志和持久化Python内核 深读这一段 讨论的问题: 当前AI Agent系统面临哪些关键工程挑战?
论据 / 案例: AutoSaddler在GAIA2上提升9.0分,SWE-Bench Pro提升9.6分;SWE Refactor Bench测试中仅5.4%任务能完成全部三个阶段。
04
本地优先Agent产品发布 05:00 Perplexity在NVIDIA DGX Spark上推出Portable Computer,实现完全本地运行的Agent 本地堆栈使用PPLX 27B模型,Qwen 3.8 27B也可用 Apple通过M5 Ultra Mac Studio和M6/M5 Pro Mac Mini推进本地AI工具 exo框架强调Thunderbolt 5的低延迟RDMA,4台M5 Ultra可聚合约4.8 TB/s内存带宽 深读这一段 讨论的问题: 本地优先AI Agent产品如何实现无云依赖的运行?
论据 / 案例: Perplexity Portable Computer在NVIDIA DGX Spark上运行,包含本地LLM编排器、子代理和Agent框架;exo框架在4台M5 Ultra上实现4.8 TB/s聚合内存带宽。
05
模型与检索基础设施进展 07:00 Qwen 3.8模型在部署和评估中表现突出,Together提供微调和推理支持 Qwen3.8-27B在Image-to-WebDev Arena达到开源模型第一、总排名第七 Hugging Face详细介绍了Papers with Code搜索引擎架构:PostgreSQL + pgvector Keenable以2600万美元种子轮融资推出面向Agent规模的Web搜索API 深读这一段 讨论的问题: 当前AI模型和检索基础设施有哪些重要进展?
论据 / 案例: Qwen3.8-27B定价为0.40/3美元每百万输入/输出token;Hugging Face搜索堆栈使用Qwen 3 Embedding 0.6B模型和NVIDIA L4生成嵌入。
06
机器人数据集与物理建模 09:00 Figure推出Index,号称全球最大最多样的机器人数据集,已支付1500万美元数据费用 Index数据集处理速度达每秒30分钟视频上传,已有1600万视频上传和26.4万次下载 Figure计划未来12个月在数据和计算上投入10亿美元 Anima Anandkumar的Accelerated Understanding声称预训练时达1T参数、推理时达5T上下文 深读这一段 讨论的问题: 机器人数据和物理世界建模领域有哪些突破性进展?
论据 / 案例: Figure Index数据集支付1500万美元,计划投入10亿美元;Accelerated Understanding声称预训练1T参数、推理时5T上下文。
07
行业讨论热点总结 10:50 OpenAI芯片发布成为最大技术讨论话题,Sam Altman的推文获得极高互动 Perplexity的Portable Computer成为芯片故事外最大的产品发布 OpenAI推出WebMCP Challenge,推动网站向显式Agent接口发展 Andrew Ng的OpenWorker项目结合开源框架、本地模型和安全工作流 深读这一段 讨论的问题: 本次Hot Chips会议期间哪些话题引发了最广泛的行业讨论?
论据 / 案例: OpenAI芯片推文获得226万浏览;Perplexity产品发布是芯片故事外最大亮点;WebMCP Challenge推动Agent化网页发展。
金句
"The key metric now is shifting to performance per watt, and Jalapeno delivers." ——现在的关键指标正转向每瓦特性能,而Jalapeño做到了。
"Jalapeño delivered 1.5–1.9× more work per watt at peak throughput and 1.7–3.6× lower end-to-end latency." ——在峰值吞吐量下,Jalapeño每瓦特完成了1.5到1.9倍的工作,端到端延迟降低了1.7到3.6倍。
"GPT-Astra + Codex helped write and optimize low-level kernels, bringing three previously unplanned open-weight models to high performance on Jalapeño in about two months." ——GPT-Astra + Codex帮助编写和优化了底层内核,在大约两个月内将三个原本未计划的开源权重模型在Jalapeño上提升至高性能。
← 上一篇 Moderna三期突破:个性化肿瘤疫苗的星辰大海 下一篇 → NVIDIA 130亿美元收购HuggingFace与开源模型新动态