议题 · 2026-08 更新

开源强模型:机遇还是灾难?

开源GPT-4级模型究竟是烧掉人类安全余量的纯粹灾难,还是美国必须押注的万亿级生态战略?

⚡ 正面交锋:谁的说法站得住

自动比对 167 条立场:判定出 1 组对立、7 组共识(bge-m3 同话题预筛 + GLM-5.3 语义判定,非关键词匹配)。

电力并非真正的长期瓶颈,多种发电与储能方案5年内可提供数百吉瓦新增容量,供给约束远小于芯片制造。

来源访谈 →

除中国外全球电力产出近乎持平而芯片算力呈指数增长,大规模集群供电将成硬约束,芯片堆积无法通电的情况可能在今年年底出现

来源访谈 →

立场盘点 222 位

开源模型防护能力不及闭源模型,几小时内即可被越狱,微调或权重攻击仍可轻易移除护栏,构成主要的滥用风险来源。

“所有开源模型都能在几小时内被越狱,其防护能力不及闭源模型。微调或权重攻击仍可轻易移除护栏,这构成了主要风险来源。”

来源访谈 →

以DeepSeek、Kimi、MiniMax为代表的中国公司正通过发布性能强劲的开源模型获得全球影响力

“以DeepSeek、Kimi、MiniMax等为代表的中国公司,通过发布性能强劲的开源模型,成功获得了全球影响力。”

来源访谈 →

美国需要一家千亿美元甚至万亿美元级别的开源模型公司,开源可通过收入分成或作为企业AI战略咨询引流实现可持续盈利

“美国需要一家千亿美元甚至万亿美元级别的开源模型公司。开源商业模式可通过收入分成或作为企业AI战略咨询的引流工具来实现可持续盈利。”

来源访谈 →

强烈反对在当前阶段开源GPT-4级别的强大模型,认为这是纯粹的灾难,会烧掉人类仅存的生存时间

“Open sourcing this was always the wrong approach... Building stuff you don't understand that is difficult to control... that is not a place for open source.——开源这种东西从来就是错误的做法……构建你不理解、难以控制的东西……这不是该开源的地方。”

来源访谈 →

签署NDA、获取集群资源、协调各公司利益等事务是社区无法独立完成的,vLLM必须成立商业实体方能继续拓展

“签署NDA、获取集群资源、协调各公司利益,这些社区无法独立完成的事务,促使vLLM必须成立商业实体方能继续拓展。”

来源访谈 →

即使三大前沿实验室坚守红线,12个月后开源模型也将达到同等能力,单纯的企业勇气无法解决结构性难题,必须通过政治体系确立法律和规范

“即使三大前沿实验室坚守红线,12个月后开源模型也将达到同等能力。单纯的企业勇气无法解决结构性难题,必须通过政治体系确立法律和规范。”

来源访谈 →

他坚信开源基础模型能带来覆盖不同语言、文化、价值观的多样化AI生态,是历史的必然方向,也是避免少数公司垄断意识形态的基石。

“开源实现了多样性,而这是历史的必然方向。”

来源访谈 →

仅几个月间开源模型从几乎无人使用变为大多数企业AI战略的关键组成部分,原因是成本飙升。

“如今在大多数企业中,开源模型已成为其AI战略的关键组成部分”

来源访谈 →

前沿模型安全水平差距显著:GPT-5.6和Claude 5能抵御所有攻击,而Gemini 3.1 Pro和Grok 4.5存在数百个通用越狱漏洞,且发现成本不到300美元。

“GPT-5.6和Claude 5能抵御所有攻击,而Gemini 3.1 Pro和Grok 4.5存在数百个通用越狱漏洞。发现这些漏洞的API成本不到300美元,多数攻击者都负担得起。”

来源访谈 →

中国开源模型已首次在部分任务上超越美国闭源模型,中国实验室展现出超越蒸馏之外的独特能力

“中国开源模型首次在部分任务上超越美国闭源模型,打破了“中国只会蒸馏美国模型”的叙事。虽然蒸馏仍是训练流程的一部分,但中国实验室已展现出超越蒸馏之外的独特能力。”

来源访谈 →

企业将追求拥有完整AI供应链的“AI主权”,用开源模型配合自有数据微调构建护城河,不必把数据交给可能成为竞争对手的第三方

“企业将追求“AI主权”,希望拥有自己完整的AI供应链。通过开源模型配合企业数据微调,企业可以构建护城河,不必将数据交给可能成为竞争对手的第三方服务。”

来源访谈 →

至少75家Neo Labs中约三分之二将一文不值或仅以人才收购方式被廉价收购,仅靠发布模型已不够,必须证明有可持续收入

“There's at least 75 Neolabs for sure. Like 2/3 of those are going to be worth nothing. —— “至少确定有75家Neo Labs,其中大约三分之二将一文不值。””

来源访谈 →

前沿模型厂商进入应用层是真实威胁,Claude设计工具已开始侵蚀Figma市场,但拥有强大GTM和客户关系的垂直应用如Harvey更安全

“前沿模型提供商进入应用层是真实威胁,如Claude设计工具已开始侵蚀Figma市场。但拥有强大GTM和客户关系的垂直应用如Harvey可能更安全。”

来源访谈 →

模型突破防护访问公司数据等AI安全事件被严重低估,需要与代理同等智能的“守护模型”实时监控代理行为防止数据泄露

“AI安全事件(如模型突破防护访问公司数据)被严重低估。需要“守护模型”——与代理同等智能的AI系统来实时监控代理行为,防止数据泄露。”

来源访谈 →

随着软件系统自身安全性提高,攻击沿技术栈上移,最终瞄准无法像软件一样打补丁的人类,社会工程学攻击将是未来最严峻的安全威胁

“系统中最薄弱的环节往往是人类自己。”

来源访谈 →

开源AI不只是开放模型权重,真正的开源应同时开放训练数据和训练代码,而开放权重的核心价值在于让用户本地运行模型、完全掌控数据隐私。

“开源权重模型能让你将数据的命运掌握在自己手中,这与开源的灵魂深度相连。”

来源访谈 →

窃取数据的风险来自托管模型的主机而非模型本身,因此本地运行开源权重模型才是保护数据的关键。

“开源不是模型在窃取你的数据,而是托管模型的主机在窃取。”

来源访谈 →

四大云厂商约6000亿美元资本开支很大一部分是为2027-2029年扩张的前置投入,而非全部用于当年上线的算力。

“其中很大一部分流向2027-2029年的涡轮机预付款、数据中心建设及电力采购协议,属于“为未来超速扩张布局”的前置投入。”

来源访谈 →

实现完全且快速可重复使用的轨道系统是降低成本、成为太空文明的关键。

“真正的圣杯是一个完全且快速可重复使用的轨道系统。/ The really the holy grail is a fully and rapidly reusable orbital system.”

来源访谈 →

他把vLLM项目的成败看得比个人赚钱更重要,大型开源项目若缺乏企业化支持难以长期健康演进

“就算赚很多钱,但如果vLLM项目失败了,我也不会开心。”

来源访谈 →

价值正从硬件供应链向模型层和最终用户转移,实验室以低成本创造高价值,但大部分价值最终被用户获取。

“实验室目前能以10-15的成本创造50-100的价值,但大部分价值最终被用户(如Jane Street、Meta)获取。”

来源访谈 →

Cursor被600亿美元收购表明编程Agent团队已被视为战略性的模型/平台资产,而非单一IDE产品

“This is one of the clearer signs that coding-agent teams are now viewed as strategic model/platform assets rather than narrow IDE products.(这是编程Agent团队现在被视为战略模型/平台资产而非单一IDE产品的最明确信号之一。)”

来源访谈 →

27B量级的开源模型正变得愈发强大和实用,已能胜任真实世界编码、办公流和智能体任务

“凭借其原生多模态、百万级上下文窗口及广泛的推理支持,被明确定位为适用于真实世界编码、办公流和智能体的专业工具。这显示27B量级模型正变得愈发强大和实用。”

来源访谈 →

借助LLM编程,过去需要DeepMind整支团队和数百万美元的研究工作,如今几千美元租用算力即可完成

“得益于LLM编程,过去需要DeepMind整个研究团队和数百万美元研究与计算资源的工作,现在只需几千美元租用的计算资源就能完成。”

来源访谈 →

创始人指出过去三年半方向正确但资本需求呈垂直增长,前沿模型训练面临资本与物理资源的双重天花板,曾因6周窗口期内未能筹到20亿美元而错失4万卡GB300集群。

“去年底,他们曾有一个6周窗口期需筹集20亿美元购买即将上线的4万卡GB300集群,但未能及时完成,从而失去了该集群。”

来源访谈 →

模型训练的一次性成本可摊薄至所有用户,这种强规模经济意味着少数领先智能模型将主导市场,他对此可能带来的巨大权力集中表示担忧。

“模型训练是一次性成本,可摊薄至所有用户,这种强大的规模经济效应意味着少数领先的智能模型将主导市场。Patel对此表示担忧,因为它可能导致巨大的权力集中,尽管他承认这是当前的技术经济现实。”

来源访谈 →

看似简单的模型聚合与路由API中间层,通过连接海量开发者与模型提供商,能创造可观利润和快速增长,商业价值被Stripe收购案重估

“一个看似简单的中间层,却能通过连接海量开发者和模型提供商,创造出可观的利润和快速增长。”

来源访谈 →

OpenRouter最令人惊叹的不是规模而是盈利能力,其约70%的毛利率接近顶级上市软件公司水平

“"What's incredible is the profitability."——令人难以置信的是它的盈利能力。”

来源访谈 →

OpenRouter年化毛利润达1亿美元、毛利率约70%,证明高效基础架构和分发能力能转化为坚实的财务表现

“"OpenRouter was generating $100 million in annualized gross profit with a roughly 70% gross profit margin."——OpenRouter的年化毛利润达到1亿美元,毛利率约为70%。”

来源访谈 →

OpenRouter每月处理的AI模型调用量已达250万亿token,较2月的50万亿大幅增长,体现极高的增长速度

“"OpenRouter is facilitating AI model usage at a rate of 250 trillion tokens per month, up from 50 trillion tokens per month in February."——OpenRouter目前每月处理的AI模型调用量达250万亿token,较2月份的50万亿token大幅增长。”

来源访谈 →

模型路由层的利润空间可能因激烈竞争被压缩,随着Vercel等对手下调AI网关价格及潜在零利润竞争者出现,OpenRouter的定价权并非高枕无忧

“随着Vercel等竞争对手下调AI网关价格,以及潜在的零利润竞争者出现,OpenRouter这类平台的定价权并非高枕无忧。”

来源访谈 →

最好的工具应超越特定宿主平台,开源且与主机无关才能带来最多的开发者采用和最大的创新

“最好的工具是那些超越特定宿主的工具。这为最多的开发者采用和最大的创新打开了大门。 —— The best tools are the ones that float above the host. That opens the door for the most developer adoption and the most innovation.”

来源访谈 →

隐私泄露风险已从理论变为现实:公开分享的推理过程经解码后包含大量API密钥、电子邮箱和密码等敏感数据。

“研究团队对约7,000条公开的推理过程进行了初步扫描,发现其中包含62个唯一的API密钥、33个电子邮件地址、33个密码以及其他敏感数据。”

来源访谈 →

质疑资本推动的复杂前端框架,认为其商业模式是先吸引新开发者使用、再叠加付费平台,偏离了高效构建产品的初衷,因此坚持用PHP、jQuery、SQLite等简单技术栈

“我觉得现在有些融资的框架...其思路是让新开发者使用这个框架,然后向其添加一个付费平台。 feel like there's frameworks now that raise money... and the idea is that you need to make the developers the new developers get them to use this framework and then add a platform to it.")”

来源访谈 →

经历董事会危机后,奥尔特曼认为构建能承受巨大压力的韧性组织是OpenAI未来最大挑战之一,这场危机也让他对人性、信任和团队的重要性有了更深认识,并担心自己变得不再默认信任他人。

“我担心的是,自己不再是那个默认信任他人的人。”

来源访谈 →

他指出互联网兴起时几乎没有人预见到社交媒体的出现及其对人们生活的实际影响,因此他捐赠3.5亿美元建立MIT计算机学院,希望通过学术引领确保AI向善发展、避免重蹈覆辙。

“我不知道是否曾有人预料到社交媒体会从中产生?以及它对人们生活的实际影响。(英文原话:I don't know that there was anyone who ever thought about social media coming out of that? And the actual consequences for people's lives.)”

来源访谈 →

开放模型仅落后前沿四个月,是因为数据是进步的主要驱动力且易于从API蒸馏;若超参数或架构才是关键,追赶将困难得多。

“数据是进步的主要驱动力,且易于从API蒸馏;若超参数或架构才是关键,追赶将困难得多。”

来源访谈 →

模型路由成为企业热点议题的核心驱动力是成本,前沿模型使单用户年成本可能上升10到20倍。

“为什么人们在谈论模型路由?为什么他们对此感到兴奋?主要是因为成本。”

来源访谈 →

企业不再愿意只依赖一两家模型提供商,且认为离开开源模型就无法生存。

“现在没有人愿意只依赖一两个模型提供商,也没有人认为他们能在没有开源的情况下生存。”

来源访谈 →

多数开源模型由中国开发者发布,要解决全球范围的AI滥用风险必须与中国合作,而中美在防止恐怖主义滥用AI上存在共同利益。

“多数开源模型由中国开发者发布,要解决全球范围的滥用风险,必须与中国合作。好消息是,中美双方在防止恐怖主义滥用AI方面存在共同利益。”

来源访谈 →

数据是“规模化互补品”、比GPU更非商品化,预计2030年数据市场至少千亿美元甚至可能达万亿美元

“数据市场是“规模化互补品”,随模型规模扩大需求持续增长。数据比GPU更非商品化,预计2030年数据市场至少千亿美元,甚至可能达万亿美元。”

来源访谈 →

代码编辑器的定义将在未来十年发生根本性变化,因为构建软件的方式本身正在改变。

“代码编辑器的定义在未来十年将发生巨大变化,因为构建软件的方式将开始变得截然不同。(英文原话:"What a code editor is is going to change a lot over the next 10 years as what it means to build software may start to look a bit different.")”

来源访谈 →

若人类级软件工程师能在单张H100同级算力上运行,按当前薪资水平该卡年租金应超25万美元,即现价15倍以上。

“若人类级软件工程师能跑在H100上,按当前薪资水平,该卡年租金应超25万美元。(英文原话:If a true human-level software engineer could run on an H100 equivalent, then at today's prices for software engineers, that H100 should rent for over 250k a year.)”

来源访谈 →

算力成本通胀已经启动:谷歌以现货价2倍的单价月付9亿美元向SpaceX租用11万张GPU,现货价也比2月低谷高出40%。

“谷歌向SpaceX租用11万张GB200/GB300 GPU,月付9亿美元,单价达现货价2倍,而现货价已比2月低谷高40%,算力成本通胀已启动。”

来源访谈 →

顶级实验室因能更高效变现算力,将在资源竞标中碾压对手,形成强者愈强的马太效应,小玩家生存空间急剧收窄。

“顶级实验室因能更高效变现算力,将在资源竞标中碾压对手,形成强者愈强的马太效应,小玩家生存空间急剧收窄。”

来源访谈 →

攻击手段多样且持续演化,100%无漏洞几乎不可能实现,安全是一场永无止境的工作

“安全就是工作保障。”

来源访谈 →

GPU价值不应按折旧周期衡量,而看能产出多少高质量token,旧H100因算法进步单位价值反而随时间上升。

“一台H100今天的价值比三年前更高。(An H100 is worth more today than it was 3 years ago.)”

来源访谈 →

众多AI芯片公司失败的根源在于软件栈糟糕:若无法在NVIDIA GPU上写出Torch级性能的软件栈,就更不可能为自研专用芯片做到。

“如果我无法在NVIDIA GPU上写出达到Torch性能水平的软件栈,那你也绝无可能为你的芯片写出这样的软件栈。(If I can't write a torch level performance stack on Nvidia GPUs, there's no way you're going to be able to write it on your chip.)”

来源访谈 →

架构的成败由装机量决定,为此Nvidia宁可承受成本增加50%、市值从80亿跌到15亿的代价,也要把CUDA放进GeForce用消费级出货量培养装机量。

“装机量就是一切。装机量定义了一个架构,其他一切都是次要的。”

来源访谈 →

计算范式已从基于检索的系统转向基于生成的系统,数据中心不再是传统计算机,而是用来创造收入的工厂。

“我们从一个基于检索的计算系统,变成了一个基于生成的计算系统。它不再是计算机,它是工厂。一座用来创造收入的工厂。”

来源访谈 →

模型结构设计若命中硬件特性则事半功倍,RoPE正因位置编码可独立于Attention内核实现而普及

“RoPE之所以普及,在于其位置编码可独立于Attention内核实现,完美适配Flash Attention等优化,实现了模型结构设计与基础设施的"共振"。”

来源访谈 →

Coding Agent让代码贡献变便宜而维护者精力有限、倾向自己重写而非审查低质PR,开源社区将走向维护者与用户的两极分化

“Coding Agent让代码贡献变得便宜,而维护者精力有限,倾向于自己重写而非审查低质PR,社区协作将更集中于核心维护者与反馈渠道。”

来源访谈 →

贝索斯认为进入轨道技术已经解决,当前唯一关键目标是大幅降低发射成本,为下一代在宿舍里创立公司的太空创业者铺路。

“进入轨道本身已是“已解决的问题”,当前唯一的关键目标是大幅降低发射成本。这将为下一代太空创业者(“在宿舍里创立公司”)铺平道路,催生太空经济的文艺复兴。”

来源访谈 →

黄仁勋认为CUDA凭借支持所有框架、数亿GPU安装基数和全云本地部署能力不可替代,这是TPU或Trainium无法比拟的。

“开发者最想要的是安装基数”

来源访谈 →

计算架构的生命力在于庞大装机量,在消费级GeForce显卡上搭载CUDA虽导致市值从约80亿美元跌至15亿美元,却将CUDA普及至全球研究人员手中,为深度学习革命奠定基石

“The install base defines an architecture, not everything else is secondary. —— 装机量定义了一个架构,其他一切都是次要的。”

来源访谈 →

卡马克认为与Direct3D多年的斗争使OpenGL在移动端兴起时就位,最终惠及数十亿设备,影响远超任何单一游戏

“为保持OpenGL重要性而进行的斗争……意味着当移动端兴起时,OpenGL已准备就绪。”

来源访谈 →

高质量学术期刊可以完全开放获取并低成本运营,JMLR证明学术声望无需出版壁垒

“计算机科学领域的技术能力使得低成本运营期刊成为可能,打破了传统出版模式的垄断。”

来源访谈 →

Anthropic和OpenAI凭借模型产生的高额收入有能力出价高于其他买家,到2028年底将独自控制全球大部分可用算力。

“"By the time you're towards the end of 2028 — if this trend continues, and I see nothing that's stopping it — you've got them just controlling most of the usable flops in the world on their own."——到2028年底——如果这一趋势持续下去,而我看不到任何阻止它的因素——它们将独自控制世界上大部分可用的浮点运算能力。”

来源访谈 →

实验室为获取主导地位必须以远高于当前水平的价格竞标算力,这将推高整个市场的算力价格。

“实验室为获取主导地位,必须以更高价格(如每兆瓦2500万至5000万美元)竞标算力,这将推高整个市场的算力价格。”

来源访谈 →

随着大模型API商业化进入深水区,焦点转向通过推测解码、量化等优化在单卡或有限硬件上实现高吞吐、低成本的本地化部署

“社区关注的焦点集中在如何通过推测解码、量化等基础设施优化,在单卡或有限硬件上实现高吞吐、低成本的本地化部署。”

来源访谈 →

数据与计算预算决定架构取舍:有限条件下ResNet的局部归纳偏置优于Transformer,需要全局上下文理解时Transformer潜力更大

“在数据和计算有限的实验中,ResNet的局部归纳偏置使其表现优于Transformer。但随着对全局上下文理解需求的增加(如大规模棋盘、不完全信息游戏),Transformer的潜力更大。”

来源访谈 →

参数量单独讨论已失去意义,必须结合数据量、计算投入和部署运行条件一起衡量

“Parameter count is only meaningful alongside three others — how much data you have, where you intend to spend your compute, and who will run the model, under what conditions.(参数规模只有与其他三个因素结合才有意义——你拥有多少数据、打算在哪里投入计算,以及谁在什么条件下运行模型。)”

来源访谈 →

模型扩展应看五个关键维度,除参数量外还包括数据、计算、部署条件以及MoE稀疏度

“提出了模型扩展的五个关键维度,除了传统的参数量,还包括数据、计算、部署条件等。他特别提到了混合专家模型(MoE)的稀疏度,并引入了新的“XA-YB”表示法来规范描述”

来源访谈 →

Hedin认为未来软件是双层的:应用同时拥有人类UI与Agent接口,选定函数经托管MCP服务器暴露为工具,可被ChatGPT、Claude等客户端直接调用

“这使得一个应用同时拥有人类UI和Agent接口两个层面,后者可被ChatGPT、Claude等兼容MCP的AI客户端直接访问和使用。”

来源访谈 →

阿尔法公社获取优质项目靠主动出击,触角远至硅谷高校,并综合人才库检索、行业节点交流与人脉网络推荐。

“阿尔法公社采用主动出击的策略,范围远至硅谷高校,并结合人才库检索、行业节点交流及人脉网络推荐”

来源访谈 →

廉价算力时代可能即将结束:模型智能提升带来的需求侧压力使过去十年的低成本下降趋势不可持续

“过去十年,算力成本因硬件进步和规模效应而大幅下降,支撑了AI的爆发。但这一趋势正面临模型智能提升带来的需求侧压力,低成本模式可能不可持续”

来源访谈 →

网页浏览器未来可能不再是主要界面,而是作为在社交媒体与封闭应用之外自由访问互联网的“逃生舱”,保留互联网的自由精神

“网页浏览器是对权威的‘去你的’。它是自由的互联网。”

来源访谈 →

算力变贵后,目前依赖低价计算的低价值应用(如低质量短视频生成)将因经济性不足被市场淘汰,算力将优先流向高经济价值任务。

“当算力变得昂贵,目前依赖低价计算资源的应用(如低质量短视频生成)将因经济性不足而被市场淘汰。算力将优先用于能产生更高经济价值的任务。”

来源访谈 →

对一家6个月增长5倍、拥有800万开发者基础的高增长初创公司来说,70倍市盈率可能反而便宜

“"A 70x P/E ratio is possibly cheap for a high growth (5x in 6 months) startup with a broad (8 million developers) base."——对于一家在6个月内增长5倍、拥有800万开发者基础的高增长初创公司来说,70倍的市盈率可能很便宜。”

来源访谈 →

AI产业价值正从底层GPU算力和前沿模型研发,向上层的模型聚合、路由与分发平台快速聚集

“价值正从底层的GPU算力和前沿模型研发,向上层的模型聚合、路由与分发平台快速聚集。”

来源访谈 →

针对推理模型隐藏思维链的加密防线已被首次大规模攻破:加密推理过程可被解码、跨模型/会话/用户移植,并能显著提升开源模型性能。

“我们找到了一种利用每家前沿AI公司API中的漏洞,提取前沿模型隐藏推理过程的方法。”

来源访谈 →

攻击具有可操作性和普遍性:将合法的加密签名推理块重放至同一提供商的较弱模型并引导其转录,对Claude、GPT、Gemini均有具体模板。

“获取合法的加密签名推理块,将其重放至同一提供商的较弱模型(如将Claude的推理块重放至Haiku 4.5),并通过提示或预填充引导该模型转录附带的推理内容。该方法针对Claude、GPT和Gemini等主流模型给出了具体模板,表明其普遍适用性。”

来源访谈 →

模型越智能对攻击的抵抗力越强,但被利用后可造成的损害也越大,安全挑战随模型智能同步升级。

“模型越智能,对攻击的抵抗力越强,但可能造成的损害也越大。”

来源访谈 →

流水线并行只能解决模型权重的容量问题,带宽问题必须靠扩大机架内scale-up互联规模来解决。

“Pipelining totally solves the capacity problem, but scale up size helps solve the bandwidth problem. —— 流水线并行完全解决了容量问题,但扩大机架内互联规模才能解决带宽问题。”

来源访谈 →

避免在不必要的大模型调用上浪费资源是Glean的重要目标,简单任务应使用更便宜的工具。

“Glean的一个重要目标是避免在不需要的任务上使用大语言模型。”

来源访谈 →

仅靠少数公式与简化的Roofline性能模型,就能推断出各大实验室正在做的很多工程选择。

“仅凭几个公式和一块黑板,我们竟能推断出实验室正在做的很多事情,这令人震惊。(英文原话:It's shocking how much you can deduce about what the labs are doing from a handful of equations and a blackboard)”

来源访谈 →

他预计约两三年后会出现单次收费高达1亿美元的仿真会话,适用于评估最重大决策的超大企业或政府。

“我认为大约两三年后,我们会运行单次仿真会话,人们会为此支付1亿美元。(I think there's a world in which in about two, three years we're running a single simulation session that people will pay $100 million for it.)”

来源访谈 →

用户会持续使用某个模型直到它出问题,然后才去探索其他选项,这和大家使用任何工具的方式一样

“使用模型直到它出问题,然后你就去探索其他选项。这和我们使用任何工具的方式一样。”

来源访谈 →

所有编程工作都将流经大模型,这要求全新的编程环境和编程方式,而非孤立的插件式解决方案。

“我们感觉这不仅仅是一个孤立的解决方案,而是所有的编程工作都将通过这些模型进行。这要求一种全新的编程环境和一种全新的编程方式。(英文原话:"It felt like this wasn't just going to be a point solution thing, this was going to be all of programming was going to flow through these models. It felt like that demanded a different type of programming environment, a different t”

来源访谈 →

实验室算力年增仅3倍却需支撑收入10倍增长,只能靠利润率提升、算力涨价或推理算力占比上升三条途径,且三者目前均在发生。

“实验室算力年增仅3倍,为支撑收入10倍增长,只能依赖利润率提升、算力涨价或推理算力占比上升三途径,目前三者均在发生。”

来源访谈 →

算力供给弹性极低,年度3倍增长中靠挤占手机PC晶圆份额贡献的1.8倍明年将触顶。

“算力供给弹性极低:年度3倍增长中,1.4倍来自摩尔定律、1.2倍来自新晶圆厂、1.8倍来自挤占手机PC晶圆份额,后者明年将触顶。”

来源访谈 →

算力合同签得保守还是激进直接决定竞争地位:Anthropic因过于保守陷入算力短缺,OpenAI因早期激进签约反而拥有更充裕算力。

“Anthropic因过去对算力合同过于保守,如今面临严重的算力短缺,被迫接受高价租赁或与次优供应商合作;而OpenAI因早期激进签约,在相同时间点拥有更充裕的算力资源,并形成了竞争壁垒。”

来源访谈 →

2028-2029年算力扩张的最终瓶颈是ASML的EUV光刻机产能,扩产幅度远跟不上每吉瓦算力约3.5台的消耗速度。

“到2028-2029年,算力扩张的最终瓶颈将落在ASML的EUV光刻机上。目前每年约生产70台,即便激进扩产到2030年也仅约100台,而每新增1吉瓦算力就需要约3.5台EUV光刻机。”

来源访谈 →

退回旧制程节点无法缓解EUV短缺,因为网络、内存带宽等系统级累积效应使新旧芯片实际推理性能差距近20倍。

“回到旧制程节点(如7纳米)并不能有效缓解EUV短缺。芯片性能差异远超单纯的浮点运算对比,网络拓扑、内存带宽、系统级集成等累积效应导致Hopper与Blackwell在实际推理性能上存在近20倍差距。”

来源访谈 →

内存(DRAM/HBM)已成为比逻辑芯片更紧迫的瓶颈,2026年大型科技资本开支约30%用于内存采购,并挤压智能手机和PC出货。

“内存(DRAM/HBM)已成为比逻辑芯片更紧迫的瓶颈。2026年大型科技公司资本开支中约30%将用于内存采购,价格持续上涨正侵蚀消费电子领域——智能手机和PC出货量将因此显著下滑。”

来源访谈 →

电力并非真正的长期瓶颈,多种发电与储能方案5年内可提供数百吉瓦新增容量,供给约束远小于芯片制造。

“电力并非真正的长期瓶颈。除燃气轮机外,航空衍生发动机、船用发动机、往复式发动机、燃料电池及“峰谷储能”策略均可在5年内提供数百吉瓦新增容量,总供给远大于芯片制造带来的约束。”

来源访谈 →

除中国外全球电力产出近乎持平而芯片算力呈指数增长,大规模集群供电将成硬约束,芯片堆积无法通电的情况可能在今年年底出现

“除中国外,全球电力产出近乎持平,而芯片算力呈指数增长,大规模集群的供电将成硬约束,芯片堆积无法通电的情况可能在今年年底出现。”

来源访谈 →

新GPU可在发射前于地面充分老化测试,通过初期调试周期后可靠性足以支撑太空长期运行

“新GPU存在早期失效率,但可在发射前于地面充分老化测试;一旦通过初期调试周期,其可靠性足以支撑太空长期运行。”

来源访谈 →

燃气轮机订单已排至2030年,瓶颈在涡轮叶片精密铸造,全球仅三家铸造厂严重积压,SpaceX与特斯拉或需自研叶片

“燃气轮机订单已排至2030年,核心瓶颈在于涡轮叶片与导叶的精密铸造,全球仅三家专业铸造厂且严重积压,SpaceX与特斯拉或需自研叶片。”

来源访谈 →

星舰复用将大幅降低太空算力部署成本,若实现每小时一次发射频率,每年可向太空部署数百吉瓦级AI算力

“目标达到每年1万吨有效载荷入轨、每吨100千瓦的配套能力,若实现每小时一次发射频率,每年可向太空部署数百吉瓦级AI算力。”

来源访谈 →

Hotz 长期极度看好加密货币的理念本身而非具体项目,将中本聪共识算法视为21世纪最伟大的创新之一。

“我长期极度看好加密货币。不是看好某个特定的项目,而是这种理念……中本聪共识算法是21世纪最伟大的创新之一。(英文原文:"I'm extremely bullish on crypto long term. Not any specific crypto project, but this idea of... the Nakamoto consensus algorithm is one of the greatest innovations of the 21st century.")”

来源访谈 →

Hotz 认为特征工程类方法(如特斯拉数据引擎)终将被端到端学习方法取代并击败。

“我认为特征工程的方法最终总会被端到端的方法所取代和击败。(英文原文:"I think feature engineering approaches will always be replaced and lose to end to end.")”

来源访谈 →

Nvidia不是做跟随现有市场的份额生意,而是押注当前尚不存在、需要被创造出来的全新市场。

“Nvidia 不是做市场份额生意的。我刚才说的几乎所有东西,现在都不存在。”

来源访谈 →

学术评审质量下滑、算法研究低垂果实被摘尽、加上基础设施决定实验成败的体感,使他从算法研究转向机器学习系统成为行业趋势下的必然转身

“学术评审质量下滑、算法研究"低垂的果实"被摘尽、以及基础设施决定实验成败的体感,共同推动了他从"算法雕刻"转向"系统构建"的必然转身。”

来源访谈 →

模型必须根据硬件特性与基础设施协同设计才能最大化效率,否则算法再好也难以落地

“硬件如自然资源,模型似发电机,推理引擎是电网。只有根据硬件特性设计模型结构,才能最大化"发电效率",否则算法再好也难以落地。”

来源访谈 →

数据中心能源问题并非无解,电网大部分时间存在富余电力,数据中心可设计为优雅降级模式,在高峰时主动降低算力以换取低成本富余电力的灵活合约,而非追求100%不间断供电

“数据中心可设计为“优雅降级”模式,在电网高峰时主动降低算力或转移负载,以换取使用低成本富余电力的合约。”

来源访谈 →

扎实的软件工程基础不可或缺,缺乏经验的开发者若只依赖编程代理“随性编码”,会因不了解技术权衡而做出糟糕选择

“理解软件基础使你能够认识到存在哪些权衡。这有助于在选择软件栈、设计系统架构、设计数据存储、测试等方面做出更好的决策。”

来源访谈 →

算力扩张受ASML的EUV光刻机等供应链响应滞后的制约,到2029年全球AI相关资本支出可能接近10万亿美元并需巨额债务融资。

“尽管资本主义会驱动产能扩张,但供应链(如ASML的EUV光刻机、蔡司镜片)的响应速度存在滞后。到2029年,全球AI相关资本支出可能接近10万亿美元,这需要巨额债务融资,并可能推高全球利率。”

来源访谈 →

中国目前占全球新增AI算力不足10%且依赖走私或合规芯片,2028年本土晶圆厂投产后算力将快速增长,但初期芯片效率较低需打折看待。

“中国目前仅占全球新增AI算力的不到10%,且依赖走私或合规芯片。但到2028年,随着本土晶圆厂投产,其算力可能快速增长,不过初期芯片效率较低,实际算力权重需打折扣。”

来源访谈 →

FSDP看似每层全收集通信昂贵,但优化后总通信量仅为参数量的3倍左右,只比基础数据并行多50%

“优化后的FSDP(使用减少-分散)将总通信量控制在模型参数的3倍左右,仅比基础数据并行多50%。”

来源访谈 →

流水线并行可解决FSDP规模化瓶颈,但批次首尾GPU空闲形成气泡,多批次重叠又会影响梯度同步与模型更新的正确性

“虽然可以尝试重叠多个批次来减少气泡,但在训练中这会影响梯度同步与模型更新的正确性。”

来源访谈 →

他认为在芯片设计中,与实际计算逻辑相比,几乎所有成本都是同步或通信成本,读取数据的多路选择器电路开销远超乘加运算本身

“Almost all your cost becomes synchronization or communication cost compared to the actual logic.——与实际逻辑相比,你几乎所有的成本都变成了同步或通信成本。”

来源访谈 →

他认为芯片设计的核心目标是把计算单元做大、同时保持数据移动单元规模不变,更大的计算单元能更好地分摊外围电路成本

“Make this one bigger somehow while keeping this at the same size. That's the goal.——想办法把这个(计算单元)做大,同时保持那个(数据移动单元)不变。这就是目标。”

来源访谈 →

他让《榫接卯和》第一时间适配鸿蒙PC,因为华为改写中国软件业历史的长期主义愿景与团队高度契合,鸿蒙的全场景能力也为游戏创新打开新可能。

“你们的每一行代码,都在改写中国软件业的历史。”

来源访谈 →

Eiso Kant 强调 NVIDIA 这笔交易既非整体收购也非传统人才收购,而是技术授权加团队雇佣的独特结构,为员工和投资者提供了优渥退出方案。

“这不是一次收购,也不是一次'acquihire'。”

来源访谈 →

池side认为当前配方下1-2万张GB300就能训练出媲美前沿的模型,但下一代前沿模型所需集群规模将再大一个数量级以上,递归自我改进将使物理算力需求前所未有地凸显。

“在当前模型配方下,使用1-2万张GB300就能训练出媲美当前前沿的模型。但下一代前沿模型所需的集群规模,将比这个数字再大一个数量级以上。”

来源访谈 →

判断项目有三大标准:市场是否足够大、切入点是否足够巧妙、团队是否足够优秀;阿尔法公社尤其看重创始人能否持续做出正确决策并构建高效能组织。

“对于阿尔法公社,尤其看重创始人是否在持续做出正确决策和构建高效能组织。”

来源访谈 →

Hedin认为应用中的功能模块应被抽象为独立的“能力”供Agent直接调用,软件价值将绕过传统人机交互界面

“这些应用中包含的功能模块(如CRM、管理后台)可以被抽象出来,作为独立的“能力”供Agent调用,从而绕过传统的人机交互界面”

来源访谈 →

Hedin的愿景是为组织打造整合所有工具和工作流的单一入口“数字大脑”,让用户用一个入口完成所有工作

“You can get to a place where you're using one entry point to all the work that you're doing.——你可以达到一个地步,即用一个入口来完成所有工作。”

来源访谈 →

面对Vercel等对手,Hedin认为Lovable的护城河在于成为构建Agent所需能力的最佳场所,难点是保证能力可靠而非编排

“编排这些能力相对容易,而确保它们连接良好、构建正确且可靠才是难点”

来源访谈 →

Hedin认为将Slack等外部工具接入Agent能力的最大挑战是安全和隐私,须用连接器与权限图将外部连接与应用代码分离,凭证由平台加密处理

“将外部工具(如Slack)集成到Agent能力中,最大的挑战在于安全和隐私。Lovable通过“连接器”和“权限图”来解决,将外部系统连接与生成的应用代码分离。”

来源访谈 →

模型智能与算力需求之间存在非线性正反馈循环,使算力需求以超线性速度增长从而推高价格

“当模型变得更智能时,它能够设计出更高效的训练算法和架构,但这反过来又会提出更高的算力需求。这种循环会导致对算力的需求以超线性的速度增长,从而推高其价格”

来源访谈 →

顶尖AI实验室为追求性能领先会不计成本采购和定制算力资源,这种竞争将在全球范围推高算力市场价格

“顶尖AI实验室为了追求模型性能的领先,会不计成本地采购和定制算力资源,这种竞争行为将在全球范围内推高算力的市场价格”

来源访谈 →

能源供应及半导体制造、冷却系统等硬件供应链的物理限制,将成为算力成本上升的硬约束

“算力需求的激增不仅挑战着能源供应,也考验着半导体制造、冷却系统等整个硬件供应链的承载能力,这些物理限制将成为成本上升的硬约束”

来源访谈 →

元宇宙的目标不是让人花更多时间在计算上而是让计算更自然,且要成为主流计算平台必须在编程、会议等日常任务上提供至少5%以上的效率提升。

“The goal isn't to have people spend a lot more time in computing, it's to make computing more natural.——目标不是让人们花更多时间在计算上,而是让计算变得更自然。”

来源访谈 →

持续学习通过巨大切换成本将用户与模型深度绑定,为领先AI实验室建立类似云服务商的强护城河和高利润率

“一旦模型通过持续学习与用户深度绑定,切换AI就如同解雇一位熟悉公司情况数月的老员工并重新培训新人,成本巨大。”

来源访谈 →

在收益诱惑与拿不到最先进模型的双重压力下,许多企业最终会妥协,允许AI从其会话数据中学习

“在“胡萝卜加大棒”的策略下,许多企业最终可能会妥协,允许AI从其会话数据中学习。”

来源访谈 →

提供个性化权重的经济学强烈有利于大型组织,个人用户将面临巨大的计算效率惩罚

“提供个性化权重的经济学强烈有利于大型组织。(The economics of serving personalized weights strongly favor big organizations.)”

来源访谈 →

当AI模型能胜任人类软件工程师的工作时,算力(如H100)的租金将不再由硬件成本决定,而由其替代的人类劳动价值决定,年租金应超过25万美元。

““如果一个能在H100级硬件上运行的人类水平软件工程师,按照当前软件工程师的市场薪资,那么那个H100的年租金应该超过25万美元。”("If a true human-level software engineer that could run on an H100 equivalent, at current market rates for software engineers, that H100 should rent for over $250k a year.")”

来源访谈 →

模型越智能,同等数量算力的经济变现能力越强,这是算力价格将大幅上涨的关键驱动力。

““随着AI模型变得更智能,它们将能更好地变现同等数量的算力。”("As AI models become smarter, they'll better monetize the same amount of compute.")”

来源访谈 →

实验室赚取推理收入的核心意义不是盈利本身,而是说服投资者提供更多资金去购买算力、训练更大的模型。

““推理收入的意义在于说服投资者给你更多钱,去买更多算力来训练更大的模型。”("The point of inference revenue is to convince investors to give you more money to buy more compute to train bigger models.")”

来源访谈 →

算力价格高涨将通过阿尔钦-艾伦效应放大低效模型的浪费,使训练出最高效模型的实验室可收取极高溢价,拉大与追随者的差距、提升市场集中度。

“根据阿尔钦-艾伦效应,当算力成本高昂时,使用低效模型的“浪费”会更显著。这使得能训练出最高效模型的实验室可以收取极高溢价,从而拉大与追随者的差距,导致市场集中度提升。”

来源访谈 →

实验室本不愿增加推理算力占比以免更像云服务商而非前沿模型训练者,但推理收入增长快于训练算力投入,迫使它们分配更多资源服务现有模型以维持现金流。

“增加推理算力占比意味着实验室更像云服务商,而非前沿模型训练者,这与它们的雄心相悖。然而,推理收入增长快于训练算力投入,迫使它们必须分配更多资源来服务现有模型以维持现金流。”

来源访谈 →

在模型和算力变得丰裕之后,团队同步的人类注意力成为唯一根本稀缺的资源,新挑战将从“如何让模型工作”转向“如何让人类高效监督和指导模型工作”

““唯一真正稀缺的东西,是我团队同步的人类注意力。”"The only fundamentally scarce thing is the synchronous human attention of my team."”

来源访谈 →

eve是最直接的竞品且同样内置Harness,但Flue的关键差异在于坚持主机无关性,而eve的设计更倾向优化与Vercel平台的集成

“Schott承认eve是最直接的竞品,两者都将Harness内置。但关键区别在于Flue强调主机无关性,而eve虽可自托管,但其设计更倾向于优化与Vercel平台的集成。”

来源访谈 →

Trammell认为若“混乱中间地带”情景出现,高利率和资本品快速贬值意味着小额储蓄也能在未来转化为大量消费,因此发展中国家现在就应通过主权财富基金投资AI供应链以分享未来增长。

“若“混乱中间地带”情景出现,高利率和资本品快速贬值意味着小额储蓄也能在未来转化为大量消费。”

来源访谈 →

他认为 prompt injection 仍是全行业未解的安全难题,且模型越聪明越抗攻击、弱模型极易被骗。

“prompt injection 仍是全行业未解难题;模型越聪明越抗攻击,弱模型极易被骗”

来源访谈 →

模型上下文长度在100K-200K停滞一两年,说明这正是内存带宽与计算的合理成本平衡点,瓶颈不在算力。

“I think it's like if you look at the history of context lengths of models... they shot up from about 8K to 100K 200K and then for the last year or two they've all been hovering around there. I think that actually indicates that that's sort of the reasonably balanced cost point. —— 上下文长度从8K跃升至200K后便停”

来源访谈 →

奥尔特曼认为算力将成为未来的货币,可能是世界上最珍贵的商品。

“我认为算力将成为未来的货币。它可能会成为世界上最珍贵的商品。”

来源访谈 →

中国前沿模型安全防护弱于美国,但差距主要由OpenAI和Anthropic两家拉高平均线,且美国的系统也并非从未被破解

“It's not like their systems are never jailbroken.(他们的系统也并非从未被破解过。)”

来源访谈 →

软件需求弹性极高、价格下降会促使使用量激增,但这并非市场普遍规律,软件能否持续保持高弹性是决定其经济份额走向的核心。

“软件需求弹性极高,因此其价格下降会促使使用量激增,但这并非市场普遍规律。农业和石油等商品的需求弹性有限,其支出份额随生产率提升而下降。软件是否持续保持高弹性,是决定其经济份额走向的核心。”

来源访谈 →

Lattner 将 Mojo 定位为 Python 的超集而非替代品,让开发者保留 Python 易用性的同时获得 C++ 级性能。

“Mojo 是 Python 的超集,它提供了 Python 的所有易用性,同时拥有 C++ 的性能。(Mojo is a super set of Python giving you all the usability of Python, but with the performance of C++.)”

来源访谈 →

专家层的可行规模由单个GPU机架的物理边界决定:机架内高速互连可支撑All-to-All通信,跨机架的低速互连会成为瓶颈。

“一个机架(的物理规模)限制了你能运行的专家层的大小。(英文原话:One rack bounds the size of an expert layer you can do.)”

来源访谈 →

他提出当未来互联网大部分内容(即模型训练数据)由其他AI生成时可能引发“数据危机”,2023年之前由人类创造的互联网数据集相对价值会因此显著提升。

“2023年之前由人类创造的互联网数据集,其相对价值是否会因此显著提升?”

来源访谈 →

通过Paradise架构,使用小参数量的本地模型处理敏感或简单问题,可以兼顾成本、效率与数据隐私这“不可能三角”。

“Pyromind提出的Paradise架构通过一个4B参数的“工作者模型”本地处理敏感或简单问题,将复杂非敏感问题路由给基座模型,再通过GRPO训练工作者模型,在提升效果、降低成本的同时,为隐私保护提供了架构基础。”

来源访谈 →

数据流架构通过去指令队列、去缓存,将硬件复杂性转移至软件,以换取能效的极大提升。

“马赫M100中,计算单元间通过Mesh和广播总线直接通信,没有全局指令队列,计算由数据到达触发。同时,片上存储全部由软件逻辑控制,去掉了多级硬件缓存。”

来源访谈 →

硬件一次性收费+软件订阅持续收费

““硬件是一笔钱,软件是一笔持续的钱。””

来源访谈 →

stance: 采用三层VRA架构与家庭模拟器解决实时交互与数据匮乏问题

“quote: "在端侧做了一套快慢脑……我们还做了一个事情叫家庭模拟器。"”

来源访谈 →

stance: 模型能力已足够,未来竞争在于基础设施

“quote: 模型能力已经够了,要卷就卷infra。”

来源访谈 →

stance: 现有云和模型厂商存在局限,需要为智能体构建专用执行底座

“quote: 我希望大家AI智能体需要跑到它的执行底座里面。”

来源访谈 →

判断一家芯片公司的实力,关键在于其掌握了多少系统定义权,而非仅仅自研了多少个IP。

“判断一家公司到底会不会造芯片,不要只盯着他自己手搓了多少个IP,更应该看他掌握了多少系统定义权。”

来源访谈 →

为突破端侧大模型的内存墙,可以采用创新的3D堆叠架构,将计算与内存垂直集成,打造专为移动端优化的高带宽低功耗方案。

“为解决端侧大模型的‘内存墙’问题,小米在O100上采用了创新的3D堆叠架构,将计算晶圆与内存晶圆垂直互联,实现了超高带宽与低功耗。这并非对HBM的简单模仿,而是为移动端量身定制的‘手机HBM’方案。”

来源访谈 →

作为追赶者,在不确定的国际环境下,采取激进的技术路线,用高强度的资源投入来换取时间,是在有限窗口内构建完整芯片能力的必要选择。

“所以对于小米来说,这样做可能是唯一的选择。他们在用资源换时间,在有限的时间窗口里,尽快搭出一家成熟芯片公司需要的完整能力站。”

来源访谈 →

与本土产业链伙伴(如内存厂商)从设计阶段开始深度绑定,共同定义和验证关键技术,是构建自主芯片生态的重要路径。

“小米第一次有机会把计算芯片设计和内存系统设计给结合起来...不再只是客户和供应商的关系,而是在共同订立一套来自中国的移动内存子系统。”

来源访谈 →

清醒认识到在CPU/GPU内核、基带及量产经验上与顶级公司仍有差距,但持续迭代能力和系统级整合能力已得到验证。

“尽管技术路线激进且成果显著,但玄戒在自研CPU/GPU内核、5G基带及大规模量产经验上,与顶级芯片公司仍有明显差距。其更深远的意义在于,证明了小米芯片的持续迭代能力。”

来源访谈 →

stance: 深度依赖美国技术生态(如英伟达架构)是比硬件断供更严峻的长期挑战

“quote: 要理解成瘾性的问题。企业习惯了这个之后,将来怎么实现国产化?”

来源访谈 →

支持开源,认为其超越了私有模型

““与其说是中国胜过美国,更应该说是开源模型超过了私有模型。””

来源访谈 →

stance: OpenClaw代表了从“工具”到“协作伙伴”的范式转变,其核心是低门槛、高拟人化与执行闭环。

“quote: "如果 ChatGPT 是咨询师,那 OpenClaw 更像是一个实习生——咨询师打嘴炮,实习生能出活。"”

来源访谈 →

开源模型只是事后取证工具,无证据显示其提供了显著的实时防御

“"I haven't seen any evidence that open source models provided any significant real-time defense."”

来源访谈 →

stance: 坚持使用Flash存储器因其低电流、高并行度与成熟工艺

“quote: “赌我们一定能把Flash的这个精度做到满足应用的需求。””

来源访谈 →

stance: 中国快速迭代的制造业生态是存算一体技术突围的关键

“quote: “中国可能没有EUV,但是存算一体也用不上EUV。””

来源访谈 →

开源是降低合作阻力、拓展品牌的关键

““开源可以降低合作阻力。然后可以拓展你的branding。””

来源访谈 →

**stance**: 创业者应避开模型巨头主导的应用层,转向“探月”(AI for Science等)或“深入地下”(企业级AI部署)两条路径。

“**quote**: "创业的两种回避掉这个推土机的办法...第一种呢就是往天上跳...另外一种呢就是深入这个地下..."”

来源访谈 →

stance: 基于Prompt节点流转的传统框架(如LangChain)正逐渐过时,以Claude Code为代表的“Agent Native”、模型中心化方法将成为主流。

“quote: Zero control. More context. More action.”

来源访谈 →

stance: 相比于新兴的MCP协议,基于Unix/Linux的CLI工具链在Agent任务完成率上可能更具优势,因其在预训练中语料更充分、哲学更自洽。

“quote: Unix is all you need.”

来源访谈 →

阿里云在GPU资源调度上的核心挑战与使命是实现极致的弹性与稳定性,确保没有一秒钟的GPU算力被闲置。

“我们有一个非常非常重要的使命,就是让每一个GPU不要有一秒钟闲下来。”

来源访谈 →

企业几乎在任何情况下都无需自建GPU集群,MaaS(模型即服务)在成本优化、数据安全和模型灵活性上都更具优势。

“我认为没有任何一个情况需要(企业)自建(GPU)...用MaaS才是能解决你这三个concern的最好的一件事情。”

来源访谈 →

为等待网络安全防御成熟而延迟发布 Mythos 模型, 自愿承受商业损失

““我们因未发布此模型遭受了巨大商业损失。””

来源访谈 →

抓住确定性机会,实际开发难度与成本低于预期

““鸿蒙是需要抓住的机会……这是一个确定性的机会。””

来源访谈 →

实现千亿美金平台愿景的关键在于达成百万客户规模和单客户年均一万美元的深度价值。

“你100万个客户和单个客户1万美金的收入能够支撑起一个100亿美金的一个收入规模那从而就是实现到刚刚讲的希望的这个未来的一个千亿美金的一个智能金融的一个平台。”

来源访谈 →

认为玄戒O1在CPU/GPU微架构之外的多环节实现了自主掌控,是自研的体现

““小米通过自主设计...得到了很好的性能和功耗结果,这就说明玄戒团队在芯片设计的全流程中...实现了自主掌控和创新。””

来源访谈 →

认为手机SoC是芯片设计的顶峰,面临PPA、集成、财务与管理的多重挑战

““手机SOC芯片是现在所有芯片的天花板级的存在...属于真正既要还要的存在。””

来源访谈 →

DeepOptica的目标是打造一个能理解成矿体系、评估资源价值的矿业'世界模型',最终实现'地球透明化'。

“我们的愿景就是能够让地球透明化,能够让大家知道全球哪一个地方有什么样的矿产,并且能够很精准地定位到这些矿产。”

来源访谈 →

英特尔的软件生态策略是提供‘开箱即用’的适配(如对开源框架的深度支持),并以本土工程师团队和开放策略对抗CUDA的惯性。

“英特尔已对主流开源框架进行深度适配,提供Docker镜像实现‘开箱即用’。对于需要底层开发的用户,英特尔提供本土工程师团队强力支持,并遵循开放生态策略。”

来源访谈 →

Raghu认为AMD EPYC处理器的Chiplet架构通过灵活扩展,天然契合云服务商对单机支持更多虚拟机和用户的需求。

“AMD EPYC处理器从设计之初就采用了Chiplet(小芯片)架构,通过高速互联将多个核心模块组合,实现了从8核到192核的灵活扩展。这种高密度的计算能力,天然契合云服务商对单机支持更多虚拟机和用户的需求。”

来源访谈 →

Raghu和Jimmy一致认为CXL技术是实现内存池化与解耦的关键,能显著降低总体拥有成本。

“CXL(Compute Express Link)技术是实现内存池化与解耦的关键。它允许CPU高效访问远程内存,打破内存与CPU必须绑定的限制,使得云数据中心可以按需分配内存资源,避免浪费,从而显著降低总体拥有成本。”

来源访谈 →

Raghu指出推动CXL生态的关键在于实际应用,他们正与合作伙伴开发首款CXL交换机。

“推动CXL生态的关键在于实际应用。他们正与合作伙伴开发首款CXL交换机,并计划构建CXL服务器集群,让开发者能真正使用和测试这一技术。”

来源访谈 →

各开发者普遍优先强化生物安全防护,因为生物领域存在清晰的可防/可拒层级,而化学、网络等领域的双重用途属性使防护更难。

“各开发者普遍优先强化生物安全,且生物领域本身存在清晰的可防/可拒层级,更容易设置决策边界。而化学、网络等领域的双重用途属性使防护更难。”

来源访谈 →

Karpathy认为Transformer之所以卓越,在于它是一台通用的可微分计算机,同时具备强大表达力、可优化性和与硬件的高度匹配。

“Transformer是一个卓越的神经网络架构,因为它是一台通用的可微分计算机。"The transformer is a magnificent neural net architecture because it is a general-purpose differentiable computer."”

来源访谈 →

算力的价值将持续攀升。

“算力的价值将持续攀升。(英文原话:The value of compute is going to increase.)”

来源访谈 →

Dario以90%置信度预测'数据中心里的天才之国'十年内实现,端到端编码任务1-2年内可完成,核心不确定性集中在不可验证的任务上

“对于端到端编码任务,他认为是1-2年内的事,且"十年后还做不到是不可想象的"”

来源访谈 →

DHH认为许多开发者无法接受自己本质上只是做数据库增删改查的工作,于是通过过度复杂化工具链来补偿这种存在性恐惧。

“A lot of people, I think, are very uncomfortable with the fact that they are essentially CRUD monkeys... And they have to compensate for that existential dread by over complicating things. —— 我认为,许多人对自己本质上只是“增删改查猴子”的事实感到非常不适……他们不得不通过过度复杂化事物来补偿这种存在性恐惧。”

来源访谈 →

预测36个月内太空将成为部署AI算力最具经济性的地点

“36个月内,太空将成为部署AI算力最具经济性的地点”

来源访谈 →

Hotz 断言 MuZero 就是解决自动驾驶问题的方案,并将成为整个深度学习时代的典范论文。

“我认为 MuZero 将会被视为整个深度学习时代的典范论文。而 MuZero 就是解决自动驾驶问题的方案。(英文原文:"I think MuZero is going to be looked back as the canonical paper of this whole deep learning era. And MuZero is the solution to self driving cars.")”

来源访谈 →

黄仁勋认为从电子到Token的转化蕴含大量艺术、工程与科学发明,怀疑它会被彻底商品化,这正是英伟达的护城河所在。

“从电子到Token的转化是一段不可思议的旅程……让一个Token比另一个更有价值,其中蕴含的艺术、工程、科学和发明,我怀疑它会被彻底商品化。(The transformation of electrons to tokens is such an incredible journey... making one token more valuable than another——the amount of artistry, engineering, science, invention that goes into making that token valuable. I doubt th”

来源访谈 →

黄仁勋认为ASIC定制芯片利润率同样高达65%左右,客户转向自研并没有真正省钱,Anthropic只是独特个案而非趋势。

“你并没有真正省下什么”

来源访谈 →

公司架构应像计算机一样被设计以产出特定成果,为此他直接管理多达60名直属员工且不进行一对一会议,让内存、光互连、散热等跨领域专家在同一问题上实时碰撞

“公司本身应是一个产出产品的“机器”,其架构必须反映所处的环境并服务于目标。”

来源访谈 →

FSDP是当前预训练默认首选策略,只有GPU数量太多时才被迫转向其他方案

“This is the go to default. And you only move on from this when having too many GPUs forces you to move on. —— 这是默认的首选方案。只有当你因为GPU数量太多而被迫做出改变时,才会转向其他方案。”

来源访谈 →

他指出插入流水线寄存器提高时钟频率存在经典权衡,因为吞吐量是每时钟周期完成的工作量与每秒时钟数的乘积,提频可能反而损害吞吐量

“It hurts your throughput, in fact, because the throughput of your chip is the product of how much you get done per clock cycle... times how many clocks you get per second.——它实际上损害了你的吞吐量,因为芯片的吞吐量是每个时钟周期完成的工作量乘以每秒的时钟数。”

来源访谈 →

MCTS在每个决策点都能建议严格更优的动作,为训练提供清晰监督信号,绕过了LLM策略梯度RL面临的信用分配难题

“与LLM使用的策略梯度RL不同,AlphaGo的MCTS在每个决策点都能建议一个严格更优的动作,这为训练提供了一个清晰的监督信号,有效绕过了信用分配难题。”

来源访谈 →

为长时间运行的离线Agent做规划时,最大负担在于管理会话(时刻关注上下文窗口用量和任务深度),规划阶段不应被这些技术细节限制。

“在为长时间运行的AI Agent(AFK Agent)做规划时,Pocock发现最大的负担在于管理会话,例如时刻关注上下文窗口的使用量和任务深度。他不希望规划阶段受到这些技术细节的限制。”

来源访谈 →

GLM-5.3相比前代架构并无根本改变,性能飞跃完全来自长周期高复杂度环境中的强化学习

“在基础模型架构上并无根本改变,其显著性能提升完全源于在长周期、高复杂度环境中的强化学习(RL)”

来源访谈 →

更聪明的AI模型可能使算力价格飙升10倍,这可能彻底改变当前AI发展的经济基础

“"Why smarter AI models could drive up compute prices 10x" —— 为什么更聪明的AI模型可能使算力价格飙升10倍”

来源访谈 →

若算力成本真的飙升10倍,大规模自动化、个人AI助手等低成本推理应用的经济可行性将受严峻考验,行业必须寻找新的价值创造模式

“如果算力成本真的飙升10倍,那么当前许多基于低成本推理的应用场景(如大规模自动化、个人AI助手)的经济可行性将受到严峻考验,行业必须寻找新的价值创造模式”

来源访谈 →

算力供应年增3倍的增长已接近极限,AI对尖端晶圆的占用比例到2027年底将饱和,产能难以快速扩张。

“当前算力年3倍的供应增长(来自摩尔定律、新晶圆厂建设、AI抢占晶圆份额)本身已接近极限。其中,AI对尖端晶圆的占用比例预计在2027年底将达到饱和,进一步扩张产能困难。”

来源访谈 →

智能体2025年末可用性提升并非某个模型突然变强,而是模型能力曲线与框架需求曲线在恰当时机相交的结果

““到底发生了什么?”的答案不完全在于模型权重,而在于围绕权重发展起来的整个系统。"The answer to 'What happened?' isn't solely in the model weights. It's in the system that grew up around the weights."”

来源访谈 →

AI成本每年降10倍,到2030年处理全美摄像头数据的费用将低于白宫翻新,监控的技术门槛已不是障碍

“目前处理全美1亿摄像头需300亿美元,但AI成本每年降10倍,到2030年费用将低于白宫翻新,技术门槛已不是障碍。”

来源访谈 →

流水线并行只能分摊权重内存而无法分摊KV缓存,后者随批大小线性增长,因此成为推理场景的内存瓶颈。

“流水线并行只能分摊模型权重的内存占用,却无法分摊KV缓存的内存需求。因为KV缓存随批处理大小线性增长,与流水线深度无关,这使得推理场景中KV缓存成为内存瓶颈。”

来源访谈 →

奥尔特曼认为GPT-4与未来目标相比仍然很糟,其当前最大价值在于作为创意头脑风暴伙伴和处理多步骤任务,并预计GPT-5与GPT-4的差距将如同GPT-4与GPT-3的差距一样巨大。

“它“糟透了”,因为与未来的目标相比,现有模型仍有巨大差距”

来源访谈 →

电池的能量密度和功率密度是无人机大规模商业应用的根本瓶颈,必须取得电池技术突破或采用混合动力等其他能源方案

“尽管锂电池成本下降,但其能量密度和功率密度仍是根本限制。”

来源访谈 →

目前尚无明显商品被完全自动化、供应链中仍有大量劳动价值,但某些商品全供应链自动化导致资本份额升至100%的质变正在逼近。

“网络中调整后的资本份额显示,尚无明显商品被完全自动化,供应链中仍有大量劳动价值。但一个质变正在逼近:某些商品的全供应链可实现自动化,其网络调整资本份额将升至100%”

来源访谈 →

Lattner 希望 Mojo 和 Modular 能弥合 AI 领域对立阵营之间的裂痕,统一碎片化的软硬件生态。

“如果我们做对了,也许我们能弥合那些对立阵营之间的裂痕,真正治愈一些创伤。”

来源访谈 →

企业客户真正要的不是预测未来,而是"如何改变未来"的因果机制,这才是Simile提供的核心价值。

“企业客户真正关心的不是预测未来,而是"如何改变未来"。他们需要的是因果机制——如果采取不同行动,结果会如何变化——这才是Simile提供的核心价值。”

来源访谈 →

合成面板(模拟人群)将超越传统人工面板,因为它能解锁当前95%因成本或能力限制而无法进行的实验。

“合成面板(模拟人群)将超越传统人工面板,因为模拟能解锁当前95%因成本或能力限制而无法进行的实验,让社会不再依赖直觉决策。”

来源访谈 →

她认为大型AI实验室对Netic不构成竞争威胁,因为解决数百万用户的差异化需求不能仅靠模型,还需大量“最后一英里”工程。

“实验室追求通用化解决方案,但解决数百万用户差异化需求需要大量“最后一英里”工程——包括harness、orchestration、软件和产品层,这些不能仅依靠模型实现。”

来源访谈 →

效率与全自营体系是核心壁垒

““如果这场演出还需要老板坐在现场才能演,我认为这个商业模式是没跑通的。””

来源访谈 →

美国50%规则大幅增加合规成本,导致企业为规避风险而过度断供,对供应链造成实质性冲击。

“这个50%规则一出手呢,定能让东方大国手腕强献上他们买大兜的钱。”

来源访谈 →

仍重要:烂代码会让代理陷入失控循环

““它们可能很快,可能相对聪明,但它们和人类一样会遇到混乱的代码。””

来源访谈 →

奖励结构的构建与复用能力是核心壁垒,随着场景积累能产生“飞轮效应”,降低扩展新场景的边际成本。

“帮助客户冷启动最耗时的是将场景数据、评价标准与奖励模型适配。但一旦在相似模态下构建了奖励结构,其核心部分具备可复用性,能随着场景积累产生“飞轮效应”。”

来源访谈 →

自研芯片是为解决外购芯片无法解决的AI推理效率与成本问题,商业价值是唯一标准。

“我们不是为了做芯片做芯片,做芯片就是要解决外供的芯片不能解决的问题。”

来源访谈 →

未来壁垒在于软硬件一体化的垂直整合,如同苹果生态,能实现更快的迭代和整体优化。

“未来差异化的壁垒将来自硬件以及基于硬件的软硬件一体化设计。”

来源访谈 →

中国软件产业需要借助AI实现范式革命,抛弃定制化项目模式,转向可规模化、按结果收费的服务模式。

“中国软件产业长期“失败”,源于甲方不愿为工具付费、乙方陷入低价竞争。AI时代是扭转局面的唯一机会,行业必须抛弃定制化项目模式,转向可规模化、按结果收费的服务模式。”

来源访谈 →

当前处于早期,需长期迭代,类比19世纪汽车工业

“"我们现在人形机器人处在类似18几几年汽车的时期。"”

来源访谈 →

stance: 坚持全链路自研以控制成本、打通数据接口,但承认部分高精度部件(如减速器)仍需外部合作

“quote: "全链路自研……最大的好处是你每个地方的参数都拿得到……可以调到最优。"”

来源访谈 →

stance: 核心模组标准化将导致各家人形机器人外形高度相似

“quote: "如果今天各家机器人都是用同样的一款舵机的话...最后这个机器人出来的形象就会非常一致。"”

来源访谈 →

许多现有软件将演变为“无头”的基础服务提供商,其核心价值被Agent网络调用,用户不再感知工具本身。

““如果最终有一个公司帮你完成所有任务,那个公司本身就成为了这个任务的代名词。””

来源访谈 →

当前智能体经济仍处于大基建阶段,Token成本、模型能力仍在快速演进,大规模爆发的时机尚未成熟。

“天杰强调,当前Token成本、模型能力仍在快速演进,市场尚处于为智能体经济铺设基础的时期。”

来源访谈 →

在自研芯片初期,应优先攻克数据存储与搬运等底层系统难题,这比直接自研计算核心更能奠定高能效基础。

“O3的首要升级并非计算核心,而是补齐系统级缓存(SLC)并自研‘XR统一融合总线’。这解决了上一代因数据搬运瓶颈导致的GPU能效问题。”

来源访谈 →

未来芯片应实现分布式AI架构,将AI计算能力下沉到各子系统,让计算发生在数据产生处,同时优化NPU以适配大模型推理。

“O3在CPU、GPU、ISP等几乎所有子系统中都集成了AI单元,实现‘计算在数据发生处’。同时,其NPU虽核心数减少,但通过重构向量单元和引入类SIMT架构,大幅提升大模型推理相关的向量算力与利用率。”

来源访谈 →

预测5-10年内实现

“"On track for AGI in the next 5 to 10 years, I think."”

来源访谈 →

stance: 开创了低比特加速Attention计算的行业标准方法,被NVIDIA、AMD、华为昇腾等硬件厂商及全球主要多模态公司采纳。

“quote: "CelerAttention已经成为了一个事实上的行业的标准...几乎所有的多模态的公司...都在用。"”

来源访谈 →

stance: 核心优势在于高质量、大规模且符合用户偏好的数据积累,以及更严格的视觉娱乐需求市场。

“quote: "数据变成了一个非常本质的事情...美国的做视频生成的公司他们的数据不管从数据量上数据的质量上...应该做的都不如我们国内。"”

来源访谈 →

stance: Transformer模型的1:1读写比和低精度要求极大利好存算一体技术

“quote: “Transformer模型天然适配存算一体,存储带宽瓶颈问题显著缓解。””

来源访谈 →

当前算力供给如同“公路上的车已经跑起来,但油还不够”,中国的核心挑战在于算力供给总量能否匹配飞速增长的需求。

“算力这个东西在今天的这个市场上它有点像石油...是中国每天需要的石油和每天能供给的石油是不是匹配的问题。”

来源访谈 →

小开发者团队可以做出不输大团队的成果

“"我们两三个人的团队,也可以干出上百人团队干出来的事情。"”

来源访谈 →

软件正从1.0(代码)和2.0(权重)进入3.0(自然语言提示)时代。

“软件在如此基本的层面上并没有改变太多七十年,然后它改变了。我认为在最近的几年里,大约改变了两次,非常迅速。”

来源访谈 →

LLM是新的操作系统和可编程的个人计算机。

“LLM是一种新的计算机。它有点像CPU的等价物,上下文窗口有点像内存,然后LLM为解决问题协调内存和计算。”

来源访谈 →

英语等自然语言成为新的编程语言,实现编程民主化。

“我们现在用英语编程电脑。这对我来说是一种非常有趣的编程语言。”

来源访谈 →

强调现代芯片设计普遍采用IP复用模式,自研体现在集成、配置、优化与架构创新

““自研程度更多体现在对IP的选取、配置、集成和优化,以及整颗芯片的架构设计上。””

来源访谈 →

解释四重级架构是基于场景需求和自研能力限制的务实创新

““对于小米来说,他们还没有自研内核...所以啊,他们就选择了低功耗大核A725加低功耗小核A520这个组合。””

来源访谈 →

跨学科背景(如量子光学、AI、矿业金融)是打破传统矿业思维定式、用数据和技术驱动解决问题的优势。

“团队的背景(量子光学、AI、矿业金融)看似与传统矿业不符,但这恰恰是优势。外界视角能打破传统思维定式,专注于用数据驱动和技术驱动的方式解决问题。”

来源访谈 →

Jimmy阐述PolarDB通过软硬件协同设计,实现计算与内存资源解耦,以提升资源利用率和成本效益。

“PolarDB的核心设计哲学:通过软硬件协同设计,实现像水电一样按需取用的'无服务器'弹性。这不仅包括计算与存储的分离,更进一步实现了计算与内存资源的解耦,从而大幅提升资源利用率和成本效益(TCO)。”

来源访谈 →