推理变便宜,英伟达还能赚多少? / 公司专题
AI推理更便宜,英伟达会少赚还是卖更多?
英伟达的主营利润仍在增长;Amazon则称,Bedrock大多数推理已由自研Trainium芯片承接。推理用得更多,不意味着新增订单都会交给英伟达。
快速答案
至少到2027财年二季度,英伟达并没有少赚:收入环比增长17.9%,经营利润增长19.0%,毛利率约75%。Google披露AI Mode单次响应成本降低;这一局部效率改善与英伟达公司整体盈利增长可以同时发生。更具体的压力来自客户选芯片:Amazon称Bedrock大多数推理已由Trainium承接。降本是否造成这些增长,现有披露没有回答;但自研芯片已经承接实际生产推理,竞争不再只是未来威胁。
利润还在增长,竞争也已发生
英伟达截至2026年7月26日的季度经营利润为637.34亿美元,前季为535.36亿美元。与此同时,Amazon称,Bedrock大多数推理已运行在自研Trainium芯片上。英伟达利润增长与客户使用替代芯片,正在同时发生。
这个财季,英伟达收入环比增长17.9%,经营利润增长19.0%,公司毛利率约75%,与前季接近。五个季度的收入、毛利额和经营利润连续增加。这些公司报表尚未呈现降本挤压主营利润的结果;收入也不只是推理业务,更不是GPU出货数量。
收入和主营利润连续五季增长
十亿美元十亿美元 · 独立财季
- 收入
- 毛利额
- 经营利润
获取日期: 2026-10-09 · FMP ↗
查看图表原始数值 ↓
| 财季 / 期末日期 | 收入 · USD | 毛利额 · USD | 经营利润 · USD |
|---|---|---|---|
| FY2026 Q2 2025-07-27 | 46,743,000,000 | 33,853,000,000 | 28,440,000,000 |
| FY2026 Q3 2025-10-26 | 57,006,000,000 | 41,849,000,000 | 36,010,000,000 |
| FY2026 Q4 2026-01-25 | 68,127,000,000 | 51,093,000,000 | 44,299,000,000 |
| FY2027 Q1 2026-04-26 | 81,615,000,000 | 61,157,000,000 | 53,536,000,000 |
| FY2027 Q2 2026-07-26 | 96,221,000,000 | 72,142,000,000 | 63,734,000,000 |
计算成本降低后,软件可以加入原本不划算的AI功能,也可以把节省的预算用于更充分的推理。英伟达能从中获得多少订单,要看这些用途需要多少计算、客户又选择哪套系统。
同一次降价,客户账单、资源用量和芯片商收入可能不同步。
单价、总账单和芯片商利润,是三本账
对使用者,在同一计费范围内,总支出等于平均付费单价乘以付费数量。数量增长超过抵消降价所需的幅度,总账单就会增加。更长的上下文、更多候选答案和额外验证,还会让每项工作用掉更多计算:一次服务便宜了,不代表整个服务预算缩小。
API价格却不能直接当成设备需求。模型变小、计算效率提高、硬件降价、利用率改善,或服务商让利,都可能降低客户账单。前几项可能减少完成同样工作所需的资源,让利则未必改变资源用量。判断设备需求,要比较达到同样质量的全部计算,包括失败和重试。
下方计算器只演示资源变化。假设每项任务少用40%的资源,任务数量增加60%,总资源指数为96,仍比原来低4%。抵消这项节省,任务数量要增加约66.7%。这些百分比是读者可调整的假设,不是API降价幅度,也不是测得的需求增长。
少用40%的资源,要多做多少任务才能抵消?
图解与数据对照调一调假设,看看三件事怎样共同改变结果
英伟达资源需求指数 · 原值为100
96.01.60 × 0.60 × 1.00 × 100 = 96.0
在这些假设下,任务量需增加66.7%,才能维持原资源需求。
算术示例,固定任务质量、系统口径和期间。资源消耗下降并不等于API价格下降;这里没有估计真实需求弹性,也不代表GPU采购量、营收或股价预测。
英伟达收入还隔着客户的硬件选择。新增计算可能运行在GPU、TPU或Trainium上,不同产品的售价和利润率也不同。于是总调用量增加、算力需求增加、英伟达多赚钱,不能写成同一个结果。
Google的付费使用说明,计算需求不能只从标价推算。
Google的API处理速率增加,搜索响应成本降低
Google在2026年7月22日的二季度CEO说明中称,模型API处理速率达到每分钟约220亿token,上季披露约160亿。按这两个约数计算,增幅约37.5%,公司仍称供给受限。这是两个披露时点的速率,显示使用规模扩大,不是季度累计调用量。
Google披露了哪些实际使用?
图解与数据对照| 服务 | 披露数据 | 说明 |
|---|---|---|
| 模型API | 约160亿→220亿token/分钟 | 两次披露速率约增37.5%,仍称供给受限 |
| AI Mode与搜索 | 单响应成本最低;搜索查询获得增量 | 不同服务指标,效率与使用增长并存 |
| Cloud付费客户 | 近500家,各12个月>1万亿token | 商业使用已经有规模 |
在另一条服务线,Google称AI Mode单次响应成本已降到上线以来最低,整体搜索查询同时获得增量。API与搜索服务的指标不能合成同一条价格—需求曲线。但这家运营商的经历至少说明,效率改善和使用增长可以并存,降本并未必然带来需求萎缩。
商业使用也不只停留在试用。Google还披露,近500个Cloud客户各自在过去12个月处理超过1万亿付费token。这里的token量会随模型和工作组合变化,不能换算成GPU采购;它仍比产品发布、下载量或融资消息更接近实际需求。
计算预算还可能被更深的推理消耗。OpenAI在2024年的o1研究中展示,在某些推理任务上,生成答案时投入更多计算可以改善表现。客户可以少付钱完成原来的工作,也可以用同样的钱争取更好的回答。已有付费使用,比单纯从降价推断少买算力更支持市场扩展。
Google披露了使用增长,Amazon则披露了另一件事:Bedrock的大多数推理已交给Trainium。
Trainium已在生产中,前沿模型也能用专用芯片
Amazon称,Bedrock的大多数推理已运行在Trainium上。它还表示,Claude模型使用超过100万颗Trainium2,覆盖训练和运行。前者是自家平台的部署情况,后者包含两类计算,不能当成全球推理份额;但它们都不是等待兑现的路线图。
谁更有条件选择专用芯片?
图解与数据对照| 客户与工作 | 可比较的路线 | 具体依据 |
|---|---|---|
| 规模大、持续工作、能自行优化 | 专用芯片与自有平台 | Amazon称Bedrock大多数推理已用Trainium |
| 模型常变、混合工作、要快上线 | 可复用GPU软件与网络系统 | 适配和维护负担决定部署成本 |
| 多类服务的大云厂商 | 多种硬件并用 | Google提供自有及NVIDIA加速器,支持可移植性 |
Claude的例子打破了“简单模型用专用芯片、聪明模型只能用GPU”的分法。客户是否有条件采用专用芯片,要看请求规模、工作是否持续,以及能否自行优化模型、编译器和芯片。请求量足够大,长期工程投入便能摊到更多服务上。AWS具备这样的组织条件,也已经把方案投入运行。
英伟达面临的具体竞争,是这类买方可能让自己的芯片承接更多新增工作。对模型变化快、混合工作多、又需要尽快上线的客户,可复用的GPU工具仍有价值:少做底层适配,也可能比单颗芯片便宜更重要。两类环境的差异在工程和服务成本,不在模型是否足够聪明。
大云厂商也未必只选一种硬件。Google同时提供自有与NVIDIA加速器,并支持GPU、TPU之间的软件可移植性。市场扩展可以容纳多条路线;工作越成熟、重复,客户越有条件比较不同平台的实际费用。英伟达要面对的是新增订单和定价上的竞争,而不是AI突然失去用途。
替代硬件能否用好,取决于客户要做多少适配和维护。
客户为整套系统付钱,也会自己补上替代方案
NVIDIA的开发文档描述了两类工具:Triton后端把请求分批处理、复用缓存,并支持跨设备执行;Dynamo按请求处理量和等待时间目标规划容量。这些工具试图解决的,是如何把GPU的计算能力交付成可用服务。
客户为系统中的哪些能力付钱?
图解与数据对照- 01部署变化的模型
复用软件、编译和后端,减少从头适配。
- 02让系统配合
批处理、缓存、多节点和网络共同工作。
- 03按要求完成服务
达到规定质量、等待时间和运维要求。
- 04让客户再次购买
订单、利润与回款,检验客户是否愿意持续付钱。
KV缓存保存已经算出的中间结果,供后续生成复用;等待时间目标则涉及多久开始输出、后续输出间隔多长。文档说明了功能,并未证明客户已经省下多少成本。对于反复部署新模型的客户,工具是否值得继续使用,要看它能减少多少适配工作、能否满足服务要求。
Meta提供了一个具体反例。它报告,DDA通信优化让MI300X在其特定测试配置中达到与H100相当的整体性能。这不是所有任务的硬件胜负,却说明有工程能力的大买方能改善替代系统,不必把全部集成价值都付给英伟达。AWS的自研部署体现了另一种同样依赖组织能力的路线。
英伟达因此需要持续证明:客户换模型、增加服务时,沿用它的系统仍然更值得。更快上线、减少运维负担和可靠完成工作,都可能留下订单;客户也会把这些收益与系统价格放在一起比较。软件生态是竞争筹码,不是利润永远安全的保证。
客户为何购买,产品文档只能解释一部分;这一季已经赚到多少,还要看财报。
主营利润增长,现金却没有同步跟上
英伟达这一季经营利润环比增长19.0%,净利润却只增加2.3%。如果只看净利,容易把非主营波动看成芯片业务减速。两者的差距,主要落在经营之外的收益变化。
经营利润比前季多101.98亿美元,其他收益净额少85.94亿美元,所得税费用多2.37亿美元,净利最终增加13.67亿美元。下图把这条变化拆开:净利增幅小,主要被非主营收益减少所影响,并不等于芯片主业停滞。
其他收益减少,压低了净利增幅
十亿美元FY2027 Q1 → Q2 · · 十亿美元 · 独立财季
查看图表原始数值 ↓
| 其他收益减少,压低了净利增幅 | USD |
|---|---|
| 前季净利 | 58,321,000,000 |
| 经营利润增加 | 10,198,000,000 |
| 其他收益减少 | -8,594,000,000 |
| 税费用增加 | -237,000,000 |
| 本季净利 | 59,688,000,000 |
获取日期: 2026-10-09 · 来源与说明 ↗
现金则是另一项需要认真对待的变化。二季度经营现金240.77亿美元,环比下降52.2%,同比仍增长56.7%;应收余额环比增加54.9%,快于收入的17.9%。公司确认了更多收入和利润,经营现金却没有同步增加。回款、合同账期、公司付款时点和营运资本,都关系到这项差异。
这一季利润与现金走向不同,还不能把现金下降归因于芯片替代。利润何时变成现金,要区分客户回款、合同账期与公司自身付款。一次季度现金下降,不能说明推理需求正在萎缩。
需求在增加,订单归属仍要争取
截至最新披露季度,英伟达仍在增加收入和主营利润,Google的模型API使用规模也在扩大。现有资料没有显示“计算更便宜,生意就缩小”这一简单结果,也没有证明降本造成了这些增长。对英伟达,更值得追问的是:这些新增工作会不会继续购买它的系统?
Amazon已经运行的Trainium给出了具体反方。如果大客户把更多新增推理交给自研芯片,同时英伟达的毛利额与经营利润持续受压,即使付费使用增加,也应下调对其系统优势的判断。相反,新增订单继续选择英伟达、主营利润持续增长,会加强这项判断;能否按合同收回货款,还要单独检验。
更新记录⌄
- 2026年10月10日:沿用财报、客户使用与芯片部署资料,重新编辑正文和图文说明。
- 客户新增用途、硬件选择、季度盈利或回款出现实质变化时,修订相关解释。
来源与说明⌄
财务数据为NVIDIA公司合并口径、美元、单个季度;主要财季截至2026年7月26日,8月26日披露。FMP MCP取得日期:损益为10月9日,现金与资产负债为10月8日。Google和Amazon的使用及部署数据来自运营商自述,各有服务与时期范围;开发文档与历史测试不代表独立客户实测。资源计算器使用假设值。本文分析业务,不预测GPU出货、行业需求弹性或股票回报。
FMP:英伟达季度损益⌄
FMP:英伟达季度损益 ↗公司总收入与盈利;非AI分部利润或投资回报。
原文章节 · Quarterly income statements: revenue, gross profit, operating income, other income and tax expense.
获取日期: 2026-10-09 · 披露日期: 2026-08-26FMP:英伟达季度现金流⌄
FMP:英伟达季度现金流 ↗公司总量USD、独立单季;两桥使用同组季度记录。
原文章节 · Quarterly cash-flow statements: net income, noncash adjustments and working capital.
获取日期: 2026-10-08 · 披露日期: 2026-08-26FMP:英伟达期末应收账款⌄
FMP:英伟达期末应收账款 ↗应收是时点余额;增速不代表实际收款天数或逾期额。
原文章节 · Quarter-end balance sheets: accounts receivable.
获取日期: 2026-10-08 · 披露日期: 2026-08-26Meta:推理通信与DDA⌄
Meta:推理通信与DDA ↗具体买方测试及目标,非所有任务、全成本或已达标。
原文章节 · Inference communication bottlenecks; DDA performance tests on MI300X and H100.
获取日期: 2026-10-09 · 披露日期: 2025-10-17NVIDIA Dynamo调度开发文档⌄
NVIDIA Dynamo调度开发文档 ↗当前开发文档能力与限制,非客户实测节省。
原文章节 · Capacity planning: throughput, first-token latency and output-token intervals.
获取日期: 2026-10-09NVIDIA Triton TensorRT-LLM后端⌄
NVIDIA Triton TensorRT-LLM后端 ↗后端功能、核心基准排除前后处理,不作业务ROI。
原文章节 · TensorRT-LLM backend: batching, KV cache, multi-node execution and benchmark scope.
获取日期: 2026-10-09Google 2026二季度:AI需求与效率⌄
Google 2026二季度:AI需求与效率 ↗运营方自述:API使用、搜索单响应成本与Cloud付费量分别保留;非同任务因果实验或NVIDIA采购量。
原文章节 · Q2 2026 CEO remarks: model API usage, AI Mode, paid Cloud tokens and AI infrastructure.
获取日期: 2026-10-10 · 披露日期: 2026-07-22Amazon:Trainium与生产推理⌄
Amazon:Trainium与生产推理 ↗AWS运营方声明,Bedrock内部大多数非全球市场份额;非同条件总成本复现。
原文章节 · Production deployment: most Bedrock inference on Trainium; Claude training and operation on Trainium2.
获取日期: 2026-10-10 · 披露日期: 2026-07-31OpenAI 2024:测试时计算与推理⌄
OpenAI 2024:测试时计算与推理 ↗历史研究机制,非当前模型推荐、需求弹性或客户ROI。
原文章节 · Learning to Reason with LLMs: performance changes with test-time computation.
获取日期: 2026-10-10 · 披露日期: 2024-09-12
DisconfirmAI 编辑 · AI 协作研究。引用资料与计算口径列于上文。
独立深读
以下是独立研究页,分别解释英伟达的现金、回款和合同责任。选择感兴趣的问题即可阅读全文。
英伟达利润几乎没变,经营现金为何少了一半?
2027财年二季度,净利润环比增加2.3%,经营现金却减少52.2%。把两季现金流逐项对起来,真正的变化在应收、预付和付款时点;特定客户的延长账期,则让“卖出设备就收回资金”的直觉失效。
阅读全文 ↗独立研究英伟达应收增长比收入快,能证明客户付不起钱吗?
应收环比增加54.9%,收入增加17.9%;五家直接客户占应收约七成。这些数字揭示资金占用和回款集中,离“坏账”还差到期与回收证据。
阅读全文 ↗独立研究90天到一年账期,英伟达到底承担了什么?
部分大型采购的交货日与付款日分开。账期的代价首先是等钱;贸易信用、实际逾期和未来容量采购,不能混作一笔客户融资。
阅读全文 ↗独立研究英伟达现金环比减半,为什么不能全归因于客户回款?
上季经营负债支持、本季预付增加和联邦税付款节奏,构成客户回款之外的解释。把税费用、税应付和现金税分开,才不会又把全部下降推给税。
阅读全文 ↗独立研究AI云容量卖不掉,英伟达何时需要接手?
一类协议把未售承诺容量留给英伟达采购。但签约、触发、采购和经济损失是四个状态,不能用一个总承诺数字把它们跳过去。
阅读全文 ↗独立研究卖出GPU以后,谁还在为AI算力扩张垫资金?
从英伟达案例看三种方向:交货后等钱、条件满足后买容量、客户先提供垫款。它们解释资金责任怎样留在合同里,不能凭匿名客户拼出产业资金闭环。
阅读全文 ↗