登录 / 注册

推理变便宜,英伟达还能赚多少? / 公司专题

AI推理更便宜,英伟达会少赚还是卖更多?

英伟达的主营利润仍在增长;Amazon则称,Bedrock大多数推理已由自研Trainium芯片承接。推理用得更多,不意味着新增订单都会交给英伟达。

DisconfirmAI 编辑部 · 首次发布 · · 最近实质更新 ·

快速答案

至少到2027财年二季度,英伟达并没有少赚:收入环比增长17.9%,经营利润增长19.0%,毛利率约75%。Google披露AI Mode单次响应成本降低;这一局部效率改善与英伟达公司整体盈利增长可以同时发生。更具体的压力来自客户选芯片:Amazon称Bedrock大多数推理已由Trainium承接。降本是否造成这些增长,现有披露没有回答;但自研芯片已经承接实际生产推理,竞争不再只是未来威胁。

01

利润还在增长,竞争也已发生

英伟达截至2026年7月26日的季度经营利润为637.34亿美元,前季为535.36亿美元。与此同时,Amazon称,Bedrock大多数推理已运行在自研Trainium芯片上。英伟达利润增长与客户使用替代芯片,正在同时发生。

这个财季,英伟达收入环比增长17.9%,经营利润增长19.0%,公司毛利率约75%,与前季接近。五个季度的收入、毛利额和经营利润连续增加。这些公司报表尚未呈现降本挤压主营利润的结果;收入也不只是推理业务,更不是GPU出货数量。

收入和主营利润连续五季增长

十亿美元

十亿美元 · 独立财季

  • 收入
  • 毛利额
  • 经营利润
收入和主营利润连续五季增长 · 十亿美元 · 独立财季NVIDIA公司总量,美元十亿美元,五个单季;非推理收入或GPU出货。展示数值=原始美元÷10亿。FMP MCP于2026年10月9日取得;主要财季2026年8月26日披露。 FY2026 Q2 2025-07-27; FY2026 Q3 2025-10-26; FY2026 Q4 2026-01-25; FY2027 Q1 2026-04-26; FY2027 Q2 2026-07-26025507510046.7433.8528.4457.0141.8536.0168.1351.0944.381.6261.1653.5496.2272.1463.73
FY2026 Q2
FY2026 Q3
FY2026 Q4
FY2027 Q1
FY2027 Q2

获取日期: 2026-10-09 · FMP ↗

查看图表原始数值 ↓
财季 / 期末日期收入 · USD毛利额 · USD经营利润 · USD
FY2026 Q2
2025-07-27
46,743,000,00033,853,000,00028,440,000,000
FY2026 Q3
2025-10-26
57,006,000,00041,849,000,00036,010,000,000
FY2026 Q4
2026-01-25
68,127,000,00051,093,000,00044,299,000,000
FY2027 Q1
2026-04-26
81,615,000,00061,157,000,00053,536,000,000
FY2027 Q2
2026-07-26
96,221,000,00072,142,000,00063,734,000,000
NVIDIA公司总量,美元十亿美元,五个单季;非推理收入或GPU出货。展示数值=原始美元÷10亿。FMP MCP于2026年10月9日取得;主要财季2026年8月26日披露。

计算成本降低后,软件可以加入原本不划算的AI功能,也可以把节省的预算用于更充分的推理。英伟达能从中获得多少订单,要看这些用途需要多少计算、客户又选择哪套系统。

同一次降价,客户账单、资源用量和芯片商收入可能不同步。

02

单价、总账单和芯片商利润,是三本账

对使用者,在同一计费范围内,总支出等于平均付费单价乘以付费数量。数量增长超过抵消降价所需的幅度,总账单就会增加。更长的上下文、更多候选答案和额外验证,还会让每项工作用掉更多计算:一次服务便宜了,不代表整个服务预算缩小。

API价格却不能直接当成设备需求。模型变小、计算效率提高、硬件降价、利用率改善,或服务商让利,都可能降低客户账单。前几项可能减少完成同样工作所需的资源,让利则未必改变资源用量。判断设备需求,要比较达到同样质量的全部计算,包括失败和重试。

下方计算器只演示资源变化。假设每项任务少用40%的资源,任务数量增加60%,总资源指数为96,仍比原来低4%。抵消这项节省,任务数量要增加约66.7%。这些百分比是读者可调整的假设,不是API降价幅度,也不是测得的需求增长。

少用40%的资源,要多做多少任务才能抵消?

图解与数据对照

调一调假设,看看三件事怎样共同改变结果

英伟达资源需求指数 · 原值为100

96.0

1.60 × 0.60 × 1.00 × 100 = 96.0

在这些假设下,任务量需增加66.7%,才能维持原资源需求。

算术示例,固定任务质量、系统口径和期间。资源消耗下降并不等于API价格下降;这里没有估计真实需求弹性,也不代表GPU采购量、营收或股价预测。

假设每项任务资源少40%,任务数多60%,相对NVIDIA系统用量系数为100,总资源指数96;抵消节省需任务数多约66.7%。质量与任务组合固定,失败尝试计入资源。系数100表示与基线相同,不是市场份额。非API折扣、实测需求或收入预测。

英伟达收入还隔着客户的硬件选择。新增计算可能运行在GPU、TPU或Trainium上,不同产品的售价和利润率也不同。于是总调用量增加、算力需求增加、英伟达多赚钱,不能写成同一个结果。

Google的付费使用说明,计算需求不能只从标价推算。

03

Google的API处理速率增加,搜索响应成本降低

Google在2026年7月22日的二季度CEO说明中称,模型API处理速率达到每分钟约220亿token,上季披露约160亿。按这两个约数计算,增幅约37.5%,公司仍称供给受限。这是两个披露时点的速率,显示使用规模扩大,不是季度累计调用量。

Google披露了哪些实际使用?

图解与数据对照
服务披露数据说明
模型API约160亿→220亿token/分钟两次披露速率约增37.5%,仍称供给受限
AI Mode与搜索单响应成本最低;搜索查询获得增量不同服务指标,效率与使用增长并存
Cloud付费客户近500家,各12个月>1万亿token商业使用已经有规模
Google CEO说明,2026年7月22日。API是两次披露的速率,37.5%由22÷16−1计算;AI Mode成本与搜索查询是另一服务的指标。客户付费token为过去12个月,各行不合成需求弹性或GPU采购量。

在另一条服务线,Google称AI Mode单次响应成本已降到上线以来最低,整体搜索查询同时获得增量。API与搜索服务的指标不能合成同一条价格—需求曲线。但这家运营商的经历至少说明,效率改善和使用增长可以并存,降本并未必然带来需求萎缩。

商业使用也不只停留在试用。Google还披露,近500个Cloud客户各自在过去12个月处理超过1万亿付费token。这里的token量会随模型和工作组合变化,不能换算成GPU采购;它仍比产品发布、下载量或融资消息更接近实际需求。

计算预算还可能被更深的推理消耗。OpenAI在2024年的o1研究中展示,在某些推理任务上,生成答案时投入更多计算可以改善表现。客户可以少付钱完成原来的工作,也可以用同样的钱争取更好的回答。已有付费使用,比单纯从降价推断少买算力更支持市场扩展。

Google披露了使用增长,Amazon则披露了另一件事:Bedrock的大多数推理已交给Trainium。

04

Trainium已在生产中,前沿模型也能用专用芯片

Amazon称,Bedrock的大多数推理已运行在Trainium上。它还表示,Claude模型使用超过100万颗Trainium2,覆盖训练和运行。前者是自家平台的部署情况,后者包含两类计算,不能当成全球推理份额;但它们都不是等待兑现的路线图。

谁更有条件选择专用芯片?

图解与数据对照
客户与工作可比较的路线具体依据
规模大、持续工作、能自行优化专用芯片与自有平台Amazon称Bedrock大多数推理已用Trainium
模型常变、混合工作、要快上线可复用GPU软件与网络系统适配和维护负担决定部署成本
多类服务的大云厂商多种硬件并用Google提供自有及NVIDIA加速器,支持可移植性
Bedrock部署是Amazon的运行声明;其他行解释选型条件。Claude超过100万颗Trainium2的陈述包含训练与运行。这里不列全球份额,也不评同条件成本冠军。

Claude的例子打破了“简单模型用专用芯片、聪明模型只能用GPU”的分法。客户是否有条件采用专用芯片,要看请求规模、工作是否持续,以及能否自行优化模型、编译器和芯片。请求量足够大,长期工程投入便能摊到更多服务上。AWS具备这样的组织条件,也已经把方案投入运行。

英伟达面临的具体竞争,是这类买方可能让自己的芯片承接更多新增工作。对模型变化快、混合工作多、又需要尽快上线的客户,可复用的GPU工具仍有价值:少做底层适配,也可能比单颗芯片便宜更重要。两类环境的差异在工程和服务成本,不在模型是否足够聪明。

大云厂商也未必只选一种硬件。Google同时提供自有与NVIDIA加速器,并支持GPU、TPU之间的软件可移植性。市场扩展可以容纳多条路线;工作越成熟、重复,客户越有条件比较不同平台的实际费用。英伟达要面对的是新增订单和定价上的竞争,而不是AI突然失去用途。

替代硬件能否用好,取决于客户要做多少适配和维护。

05

客户为整套系统付钱,也会自己补上替代方案

NVIDIA的开发文档描述了两类工具:Triton后端把请求分批处理、复用缓存,并支持跨设备执行;Dynamo按请求处理量和等待时间目标规划容量。这些工具试图解决的,是如何把GPU的计算能力交付成可用服务。

客户为系统中的哪些能力付钱?

图解与数据对照
  1. 01部署变化的模型

    复用软件、编译和后端,减少从头适配。

  2. 02让系统配合

    批处理、缓存、多节点和网络共同工作。

  3. 03按要求完成服务

    达到规定质量、等待时间和运维要求。

  4. 04让客户再次购买

    订单、利润与回款,检验客户是否愿意持续付钱。

依据NVIDIA开发文档与业务分析连接各环节;不是独立硬件实测或已测得的客户节省。Meta特定配置的替代测试与AWS部署,是买方自行优化的反例。

KV缓存保存已经算出的中间结果,供后续生成复用;等待时间目标则涉及多久开始输出、后续输出间隔多长。文档说明了功能,并未证明客户已经省下多少成本。对于反复部署新模型的客户,工具是否值得继续使用,要看它能减少多少适配工作、能否满足服务要求。

Meta提供了一个具体反例。它报告,DDA通信优化让MI300X在其特定测试配置中达到与H100相当的整体性能。这不是所有任务的硬件胜负,却说明有工程能力的大买方能改善替代系统,不必把全部集成价值都付给英伟达。AWS的自研部署体现了另一种同样依赖组织能力的路线。

英伟达因此需要持续证明:客户换模型、增加服务时,沿用它的系统仍然更值得。更快上线、减少运维负担和可靠完成工作,都可能留下订单;客户也会把这些收益与系统价格放在一起比较。软件生态是竞争筹码,不是利润永远安全的保证。

客户为何购买,产品文档只能解释一部分;这一季已经赚到多少,还要看财报。

06

主营利润增长,现金却没有同步跟上

英伟达这一季经营利润环比增长19.0%,净利润却只增加2.3%。如果只看净利,容易把非主营波动看成芯片业务减速。两者的差距,主要落在经营之外的收益变化。

经营利润比前季多101.98亿美元,其他收益净额少85.94亿美元,所得税费用多2.37亿美元,净利最终增加13.67亿美元。下图把这条变化拆开:净利增幅小,主要被非主营收益减少所影响,并不等于芯片主业停滞。

其他收益减少,压低了净利增幅

十亿美元

FY2027 Q1 → Q2 · · 十亿美元 · 独立财季

其他收益减少,压低了净利增幅NVIDIA单季净利变化,美元十亿美元,非现金桥。经营利润多101.98亿美元,其他收益少85.94亿美元,税费用多2.37亿美元,净利增加13.67亿美元。FMP MCP损益于2026年10月9日取得。58.321前季净利+10.198经营利润增加-8.594其他收益减少-0.237税费用增加59.688本季净利
查看图表原始数值 ↓
其他收益减少,压低了净利增幅USD
前季净利58,321,000,000
经营利润增加10,198,000,000
其他收益减少-8,594,000,000
税费用增加-237,000,000
本季净利59,688,000,000

获取日期: 2026-10-09 · 来源与说明 ↗

NVIDIA单季净利变化,美元十亿美元,非现金桥。经营利润多101.98亿美元,其他收益少85.94亿美元,税费用多2.37亿美元,净利增加13.67亿美元。FMP MCP损益于2026年10月9日取得。

现金则是另一项需要认真对待的变化。二季度经营现金240.77亿美元,环比下降52.2%,同比仍增长56.7%;应收余额环比增加54.9%,快于收入的17.9%。公司确认了更多收入和利润,经营现金却没有同步增加。回款、合同账期、公司付款时点和营运资本,都关系到这项差异。

这一季利润与现金走向不同,还不能把现金下降归因于芯片替代。利润何时变成现金,要区分客户回款、合同账期与公司自身付款。一次季度现金下降,不能说明推理需求正在萎缩。

07

需求在增加,订单归属仍要争取

截至最新披露季度,英伟达仍在增加收入和主营利润,Google的模型API使用规模也在扩大。现有资料没有显示“计算更便宜,生意就缩小”这一简单结果,也没有证明降本造成了这些增长。对英伟达,更值得追问的是:这些新增工作会不会继续购买它的系统?

Amazon已经运行的Trainium给出了具体反方。如果大客户把更多新增推理交给自研芯片,同时英伟达的毛利额与经营利润持续受压,即使付费使用增加,也应下调对其系统优势的判断。相反,新增订单继续选择英伟达、主营利润持续增长,会加强这项判断;能否按合同收回货款,还要单独检验。

更新记录
  • 2026年10月10日:沿用财报、客户使用与芯片部署资料,重新编辑正文和图文说明。
  • 客户新增用途、硬件选择、季度盈利或回款出现实质变化时,修订相关解释。
来源与说明

财务数据为NVIDIA公司合并口径、美元、单个季度;主要财季截至2026年7月26日,8月26日披露。FMP MCP取得日期:损益为10月9日,现金与资产负债为10月8日。Google和Amazon的使用及部署数据来自运营商自述,各有服务与时期范围;开发文档与历史测试不代表独立客户实测。资源计算器使用假设值。本文分析业务,不预测GPU出货、行业需求弹性或股票回报。

  1. FMP:英伟达季度损益
    FMP:英伟达季度损益 ↗

    公司总收入与盈利;非AI分部利润或投资回报。

    原文章节 · Quarterly income statements: revenue, gross profit, operating income, other income and tax expense.

    获取日期: 2026-10-09 · 披露日期: 2026-08-26
  2. FMP:英伟达季度现金流
    FMP:英伟达季度现金流 ↗

    公司总量USD、独立单季;两桥使用同组季度记录。

    原文章节 · Quarterly cash-flow statements: net income, noncash adjustments and working capital.

    获取日期: 2026-10-08 · 披露日期: 2026-08-26
  3. FMP:英伟达期末应收账款
    FMP:英伟达期末应收账款 ↗

    应收是时点余额;增速不代表实际收款天数或逾期额。

    原文章节 · Quarter-end balance sheets: accounts receivable.

    获取日期: 2026-10-08 · 披露日期: 2026-08-26
  4. Meta:推理通信与DDA
    Meta:推理通信与DDA ↗

    具体买方测试及目标,非所有任务、全成本或已达标。

    原文章节 · Inference communication bottlenecks; DDA performance tests on MI300X and H100.

    获取日期: 2026-10-09 · 披露日期: 2025-10-17
  5. NVIDIA Dynamo调度开发文档
    NVIDIA Dynamo调度开发文档 ↗

    当前开发文档能力与限制,非客户实测节省。

    原文章节 · Capacity planning: throughput, first-token latency and output-token intervals.

    获取日期: 2026-10-09
  6. NVIDIA Triton TensorRT-LLM后端
    NVIDIA Triton TensorRT-LLM后端 ↗

    后端功能、核心基准排除前后处理,不作业务ROI。

    原文章节 · TensorRT-LLM backend: batching, KV cache, multi-node execution and benchmark scope.

    获取日期: 2026-10-09
  7. Google 2026二季度:AI需求与效率
    Google 2026二季度:AI需求与效率 ↗

    运营方自述:API使用、搜索单响应成本与Cloud付费量分别保留;非同任务因果实验或NVIDIA采购量。

    原文章节 · Q2 2026 CEO remarks: model API usage, AI Mode, paid Cloud tokens and AI infrastructure.

    获取日期: 2026-10-10 · 披露日期: 2026-07-22
  8. Amazon:Trainium与生产推理
    Amazon:Trainium与生产推理 ↗

    AWS运营方声明,Bedrock内部大多数非全球市场份额;非同条件总成本复现。

    原文章节 · Production deployment: most Bedrock inference on Trainium; Claude training and operation on Trainium2.

    获取日期: 2026-10-10 · 披露日期: 2026-07-31
  9. OpenAI 2024:测试时计算与推理
    OpenAI 2024:测试时计算与推理 ↗

    历史研究机制,非当前模型推荐、需求弹性或客户ROI。

    原文章节 · Learning to Reason with LLMs: performance changes with test-time computation.

    获取日期: 2026-10-10 · 披露日期: 2024-09-12

DisconfirmAI 编辑 · AI 协作研究。引用资料与计算口径列于上文。

独立深读

以下是独立研究页,分别解释英伟达的现金、回款和合同责任。选择感兴趣的问题即可阅读全文。

独立研究

英伟达利润几乎没变,经营现金为何少了一半?

2027财年二季度,净利润环比增加2.3%,经营现金却减少52.2%。把两季现金流逐项对起来,真正的变化在应收、预付和付款时点;特定客户的延长账期,则让“卖出设备就收回资金”的直觉失效。

阅读全文
独立研究

英伟达应收增长比收入快,能证明客户付不起钱吗?

应收环比增加54.9%,收入增加17.9%;五家直接客户占应收约七成。这些数字揭示资金占用和回款集中,离“坏账”还差到期与回收证据。

阅读全文
独立研究

90天到一年账期,英伟达到底承担了什么?

部分大型采购的交货日与付款日分开。账期的代价首先是等钱;贸易信用、实际逾期和未来容量采购,不能混作一笔客户融资。

阅读全文
独立研究

英伟达现金环比减半,为什么不能全归因于客户回款?

上季经营负债支持、本季预付增加和联邦税付款节奏,构成客户回款之外的解释。把税费用、税应付和现金税分开,才不会又把全部下降推给税。

阅读全文
独立研究

AI云容量卖不掉,英伟达何时需要接手?

一类协议把未售承诺容量留给英伟达采购。但签约、触发、采购和经济损失是四个状态,不能用一个总承诺数字把它们跳过去。

阅读全文
独立研究

卖出GPU以后,谁还在为AI算力扩张垫资金?

从英伟达案例看三种方向:交货后等钱、条件满足后买容量、客户先提供垫款。它们解释资金责任怎样留在合同里,不能凭匿名客户拼出产业资金闭环。

阅读全文
研究专题 →