<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>nvidia &#8211; Huahua&#8217;s Tech Road</title>
	<atom:link href="https://zxi.mytechroad.com/blog/tag/nvidia/feed/" rel="self" type="application/rss+xml" />
	<link>https://zxi.mytechroad.com/blog</link>
	<description></description>
	<lastBuildDate>Thu, 09 Jul 2026 22:31:44 +0000</lastBuildDate>
	<language>en</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=6.7.5</generator>

<image>
	<url>https://zxi.mytechroad.com/blog/wp-content/uploads/2017/09/cropped-photo-32x32.jpg</url>
	<title>nvidia &#8211; Huahua&#8217;s Tech Road</title>
	<link>https://zxi.mytechroad.com/blog</link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>RTX 4070 Super 能效测试：从 100W 到 220W，甜点功耗在哪里？</title>
		<link>https://zxi.mytechroad.com/blog/hardware/rtx-4070-super-%e8%83%bd%e6%95%88%e6%b5%8b%e8%af%95%ef%bc%9a%e4%bb%8e-100w-%e5%88%b0-220w%ef%bc%8c%e7%94%9c%e7%82%b9%e5%8a%9f%e8%80%97%e5%9c%a8%e5%93%aa%e9%87%8c%ef%bc%9f/</link>
					<comments>https://zxi.mytechroad.com/blog/hardware/rtx-4070-super-%e8%83%bd%e6%95%88%e6%b5%8b%e8%af%95%ef%bc%9a%e4%bb%8e-100w-%e5%88%b0-220w%ef%bc%8c%e7%94%9c%e7%82%b9%e5%8a%9f%e8%80%97%e5%9c%a8%e5%93%aa%e9%87%8c%ef%bc%9f/#respond</comments>
		
		<dc:creator><![CDATA[zxi]]></dc:creator>
		<pubDate>Thu, 09 Jul 2026 22:26:30 +0000</pubDate>
				<category><![CDATA[Hardware]]></category>
		<category><![CDATA[3d mark]]></category>
		<category><![CDATA[graphics card]]></category>
		<category><![CDATA[nvidia]]></category>
		<category><![CDATA[power efficiency]]></category>
		<category><![CDATA[time spy]]></category>
		<category><![CDATA[显卡]]></category>
		<category><![CDATA[能效]]></category>
		<guid isPermaLink="false">https://zxi.mytechroad.com/blog/?p=10698</guid>

					<description><![CDATA[这次测试的目标很简单：不只看 RTX 4070 Super 满功耗能跑多少分，而是看看它在不同功耗限制下，性能和功耗之间到底怎么变化。 很多显卡在接近默认功耗上限时，最后一截性能往往要付出明显更高的功耗和噪音代价。4070 Super 本身能效已经不错，所以我更关心的问题是：如果把功耗限制从默认的 220W 一路降到 100W，它的 Time Spy 图形性能会怎么掉？哪一个功耗点最适合日用？ 先说结论：在我这张卡和这套测试环境里，160W 是最高能效点，180W 是更适合日用的性能/功耗平衡点。200W 以上仍然能涨分，但收益递减已经很明显。 测试方法 测试使用 3DMark Time Spy。每一档功耗限制下运行一次 Time Spy，并记录&#8230;]]></description>
										<content:encoded><![CDATA[
<figure class="wp-block-image size-full"><a href="https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/RTX-4070S-能效曲线-花花.png"><img fetchpriority="high" decoding="async" width="800" height="494" src="https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/RTX-4070S-能效曲线-花花.png" alt="" class="wp-image-10699" srcset="https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/RTX-4070S-能效曲线-花花.png 800w, https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/RTX-4070S-能效曲线-花花-300x185.png 300w, https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/RTX-4070S-能效曲线-花花-768x474.png 768w" sizes="(max-width: 800px) 100vw, 800px" /></a></figure>



<p>这次测试的目标很简单：不只看 RTX 4070 Super 满功耗能跑多少分，而是看看它在不同功耗限制下，性能和功耗之间到底怎么变化。</p>



<p>很多显卡在接近默认功耗上限时，最后一截性能往往要付出明显更高的功耗和噪音代价。4070 Super 本身能效已经不错，所以我更关心的问题是：如果把功耗限制从默认的 220W 一路降到 100W，它的 Time Spy 图形性能会怎么掉？哪一个功耗点最适合日用？</p>



<p>先说结论：在我这张卡和这套测试环境里，<strong>160W 是最高能效点，180W 是更适合日用的性能/功耗平衡点</strong>。200W 以上仍然能涨分，但收益递减已经很明显。</p>



<h2 class="wp-block-heading">测试方法</h2>



<p>测试使用 3DMark Time Spy。每一档功耗限制下运行一次 Time Spy，并记录 GPU 日志。平均功耗和平均频率不是整段日志直接平均，而是只统计 Time Spy 两段 Graphics Test 中的高负载区间，避免菜单、加载、空闲段把结果稀释。</p>



<p>功耗限制通过 NVIDIA 的 power limit 设置，测试区间为&nbsp;<code>100W</code>&nbsp;到&nbsp;<code>220W</code>。日志中记录了 GPU 功耗、GPU 利用率、核心频率和显存频率。</p>



<p>简单来说，这篇文章里的&nbsp;<code>Avg Power</code>&nbsp;更接近“跑 Time Spy GPU 测试时显卡实际吃了多少电”，而不是整场测试从开始到结束的粗略平均。</p>



<h2 class="wp-block-heading">测试数据</h2>



<figure class="wp-block-table"><table class="has-fixed-layout"><thead><tr><th>Power Limit</th><th>Time Spy GPU Score</th><th>Avg Power (W)</th><th>Time Spy CPU</th><th>Graphics Test 1</th><th>Graphics Test 2</th><th>Avg GPU Freq</th><th>Avg Mem Freq</th></tr></thead><tbody><tr><td>100W</td><td>9855</td><td>99.64</td><td>16418</td><td>65.54</td><td>55.53</td><td>1042</td><td>10501</td></tr><tr><td>120W</td><td>12564</td><td>119.42</td><td>16437</td><td>84.07</td><td>70.43</td><td>1369</td><td>10501</td></tr><tr><td>140W</td><td>15301</td><td>139.28</td><td>16240</td><td>102.46</td><td>85.72</td><td>1740</td><td>10501</td></tr><tr><td>160W</td><td>17914</td><td>159.63</td><td>16314</td><td>120.19</td><td>100.19</td><td>2179</td><td>10501</td></tr><tr><td>180W</td><td>19343</td><td>179.46</td><td>16475</td><td>127.31</td><td>109.96</td><td>2465</td><td>10501</td></tr><tr><td>200W</td><td>20133</td><td>198.33</td><td>16358</td><td>132.41</td><td>114.53</td><td>2651</td><td>10501</td></tr><tr><td>220W</td><td>20506</td><td>207.87</td><td>16396</td><td>133.18</td><td>117.93</td><td>2751</td><td>10501</td></tr></tbody></table></figure>



<h2 class="wp-block-heading">能效分析</h2>



<p>如果只看 Time Spy GPU 分数，220W 当然最高，GPU 分数为 20506。但这并不是完整故事。把 GPU 分数除以平均功耗后，就能看到每瓦性能的变化：</p>



<figure class="wp-block-image size-full"><a href="https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/RTX-4070s-每瓦性能图-花花-1.png"><img decoding="async" width="756" height="468" src="https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/RTX-4070s-每瓦性能图-花花-1.png" alt="" class="wp-image-10701" srcset="https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/RTX-4070s-每瓦性能图-花花-1.png 756w, https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/RTX-4070s-每瓦性能图-花花-1-300x186.png 300w" sizes="(max-width: 756px) 100vw, 756px" /></a></figure>



<p>这里最醒目的点是&nbsp;<strong>160W</strong>。它的 GPU 分数是 17914，平均功耗 159.63W，算下来约&nbsp;<strong>112.2 分/W</strong>，是这组测试里的最高能效点。</p>



<p>再看 180W，它的 GPU 分数提升到 19343，平均功耗 179.46W。相比 160W，多吃了约 19.8W，GPU 分数多了 1429 分，这一段提升仍然比较划算。</p>



<p>但从 180W 往上，味道就变了。180W 到 200W，平均功耗增加约 18.9W，GPU 分数只增加 790 分；200W 到 220W，实际平均功耗增加约 9.5W，GPU 分数只增加 373 分。换句话说，200W 以上更多是在榨最后一点跑分，能效已经明显下降。</p>



<h2 class="wp-block-heading">不同功耗档的感觉</h2>



<h3 class="wp-block-heading">100W &#8211; 140W：能跑，但性能损失比较明显</h3>



<p>100W 到 140W 的能效并不差，特别是 120W 和 140W，相比 100W 有明显提升。不过这几个档位的平均 GPU 频率偏低，Time Spy GPU 分数也掉得比较多。如果目标是极限省电、低热量、低噪音，它们有意义；但如果是主力游戏档，我觉得会有点压得太狠。</p>



<h3 class="wp-block-heading">160W：最高能效点</h3>



<p>160W 是这次测试里最漂亮的点。它拿到了 17914 的 Time Spy GPU 分数，平均 GPU 频率约 2179MHz，平均功耗约 159.63W。相比 220W，性能大约少 12.6%，但平均功耗低了约 48W。</p>



<p>这就是典型的安静省电档：性能仍然不错，但热量、风扇压力和整机功耗都会舒服很多。</p>



<h3 class="wp-block-heading">180W：我更愿意日用的平衡点</h3>



<p>如果只选一个日用档，我会更偏向 180W。它的 GPU 分数是 19343，已经非常接近 200W 和 220W 档，但功耗仍然控制在 180W 左右。</p>



<p>相比 220W，180W 的 GPU 分数少约 5.7%，但平均功耗少了约 28W。这个交换非常合理，尤其是对一张本来就不算高功耗的中高端卡来说，180W 很像一个“该有的性能都有，但不硬榨”的位置。</p>



<h3 class="wp-block-heading">200W &#8211; 220W：跑分更高，但收益递减</h3>



<p>200W 和 220W 的分数当然更高，平均 GPU 频率也更高。但从数据看，220W 并没有比 200W 拉开太多，Time Spy GPU 分数只高 373 分。</p>



<p>如果目标是跑最高分，220W 没问题；但如果目标是日常游戏体验、噪音和温度平衡，我不觉得默认满功耗是最优解。</p>



<h2 class="wp-block-heading">降压超频：0.90V / 0.925V 表现</h2>



<p>在基础功耗测试之后，我又简单补测了两组 VF Curve 降压定频设置，主要想看看 4070 Super 在 180W 左右能不能用更低电压换到更高、更稳定的核心频率。</p>



<p>这两组设置分别是：</p>



<figure class="wp-block-table"><table class="has-fixed-layout"><thead><tr><th>设置</th><th>Time Spy Score</th><th>Avg Power (W)</th><th>Avg GPU Freq</th><th>备注</th></tr></thead><tbody><tr><td>2550MHz @ 0.90V</td><td>19606</td><td>175.73</td><td>2550</td><td>更低电压，功耗控制更好</td></tr><tr><td>2640MHz @ 0.925V</td><td>20249</td><td>182.09</td><td>2640</td><td>频率更高，同时显存也更高</td></tr></tbody></table></figure>



<p>从日志看，<code>2550MHz @ 0.90V</code>&nbsp;这组已经比原始&nbsp;<code>180W</code>&nbsp;档更好看。之前 180W stock 的平均功耗约&nbsp;<code>179.46W</code>，平均 GPU 频率约&nbsp;<code>2465MHz</code>；而这组降压定频之后，平均功耗降到&nbsp;<code>175.73W</code>，平均 GPU 频率反而稳定在&nbsp;<code>2550MHz</code>。</p>



<p>这说明 4070 Super 在这个区间确实有降压优化空间。相比单纯拉功耗上限，VF Curve 能把显卡固定在一个更高效的电压/频率点上。</p>



<p><code>2640MHz @ 0.925V</code> 这组则更偏性能档。甚至超过了默认200W档的分数，而它的平均功耗仅为 <code>182.09W</code>，全程都没有碰到功耗墙，GPU 频率能稳定在 <code>2640MHz</code>，显存频率也小超到了 <code>11501MHz</code>。</p>



<p>所以目前看下来，我会把这两组理解成：</p>



<figure class="wp-block-table"><table class="has-fixed-layout"><thead><tr><th>Profile</th><th>定位</th></tr></thead><tbody><tr><td><code>2550MHz @ 0.90V</code></td><td>安静省电档，适合追求低功耗和低噪音</td></tr><tr><td><code>2640MHz @ 0.925V</code></td><td>日用性能档，适合替代默认 180W / 200W 设置</td></tr></tbody></table></figure>



<figure class="wp-block-image size-large"><a href="https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/Screenshot-2026-07-09-152831.png"><img decoding="async" width="1024" height="707" src="https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/Screenshot-2026-07-09-152831-1024x707.png" alt="" class="wp-image-10703" srcset="https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/Screenshot-2026-07-09-152831-1024x707.png 1024w, https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/Screenshot-2026-07-09-152831-300x207.png 300w, https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/Screenshot-2026-07-09-152831-768x530.png 768w, https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/Screenshot-2026-07-09-152831-1536x1061.png 1536w, https://zxi.mytechroad.com/blog/wp-content/uploads/2026/07/Screenshot-2026-07-09-152831.png 1578w" sizes="(max-width: 1024px) 100vw, 1024px" /></a></figure>



<p class="has-text-align-center">2640MHz@0.925V VF曲线</p>



<h2 class="wp-block-heading">结论</h2>



<p>这张 RTX 4070 Super 的能效曲线很清楚：它不是不能跑 220W，而是没必要一直跑 220W。</p>



<p>如果追求最高能效，<strong>160W 是最甜的点</strong>。它拿到最高的每瓦性能，适合安静、省电、低温的日常游戏环境。</p>



<p>如果追求更好的日用体验，<strong>180W 是我更推荐的平衡点</strong>。它比 160W 多给了不少性能，又比 220W 少吃明显功耗，实际体验上会更接近满血卡。</p>



<p>200W 和 220W 依然有意义，但更多适合跑分或者不在乎功耗噪音的场景。对我来说，4070 Super 真正好玩的地方不是把功耗拉满，而是找到 160W 和 180W 这两个甜点，再配合显存 OC 和 VF Curve，把性能、功耗和噪音调到一个舒服的位置。</p>



<p>最后提醒一下，这些数据只代表我这张卡和这套测试环境。不同品牌、散热、BIOS、驱动版本和机箱风道都会影响结果。但大方向应该类似：4070 Super 在 160W 到 180W 区间，有非常值得挖的能效空间。</p>
]]></content:encoded>
					
					<wfw:commentRss>https://zxi.mytechroad.com/blog/hardware/rtx-4070-super-%e8%83%bd%e6%95%88%e6%b5%8b%e8%af%95%ef%bc%9a%e4%bb%8e-100w-%e5%88%b0-220w%ef%bc%8c%e7%94%9c%e7%82%b9%e5%8a%9f%e8%80%97%e5%9c%a8%e5%93%aa%e9%87%8c%ef%bc%9f/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>生不逢时：Steam Machine 为什么被 PS5 和 PC DIY 夹在中间</title>
		<link>https://zxi.mytechroad.com/blog/hardware/steam-machine-born-the-wrong-time/</link>
					<comments>https://zxi.mytechroad.com/blog/hardware/steam-machine-born-the-wrong-time/#respond</comments>
		
		<dc:creator><![CDATA[zxi]]></dc:creator>
		<pubDate>Mon, 29 Jun 2026 02:31:20 +0000</pubDate>
				<category><![CDATA[Hardware]]></category>
		<category><![CDATA[amd]]></category>
		<category><![CDATA[dlss]]></category>
		<category><![CDATA[fsr]]></category>
		<category><![CDATA[gaming]]></category>
		<category><![CDATA[hardware]]></category>
		<category><![CDATA[nvdia]]></category>
		<category><![CDATA[nvidia]]></category>
		<category><![CDATA[pc]]></category>
		<category><![CDATA[SoC]]></category>
		<category><![CDATA[steam]]></category>
		<guid isPermaLink="false">https://zxi.mytechroad.com/blog/?p=10690</guid>

					<description><![CDATA[Steam Machine 不是一台没有想法的机器。恰恰相反，它可能是 Valve 这些年硬件路线里最自然的一步：Steam Deck 证明了 SteamOS、Proton、AMD APU 和掌机形态可以组成一个足够顺滑的 PC 游戏入口；那么下一步，把屏幕拿掉，把性能拉高，把它塞进电视柜，不就成了客厅版 Steam Deck 吗？ 问题是，硬件产品最怕“逻辑正确，时间错误”。 2026 年的 Steam Machine 面对的不是 2015 年那个 Linux 游戏生态尚未成熟的世界，也不是&#8230;]]></description>
										<content:encoded><![CDATA[
<p>Steam Machine 不是一台没有想法的机器。恰恰相反，它可能是 Valve 这些年硬件路线里最自然的一步：Steam Deck 证明了 SteamOS、Proton、AMD APU 和掌机形态可以组成一个足够顺滑的 PC 游戏入口；那么下一步，把屏幕拿掉，把性能拉高，把它塞进电视柜，不就成了客厅版 Steam Deck 吗？</p>



<p>问题是，硬件产品最怕“逻辑正确，时间错误”。</p>



<p>2026 年的 Steam Machine 面对的不是 2015 年那个 Linux 游戏生态尚未成熟的世界，也不是 2021 年 Steam Deck 刚出场时那个玩家渴望低价 PC 游戏入口的世界。它面对的是半导体价格上行、内存和 SSD 被 AI 需求挤压、主机平台已经进入成熟期、PC 显卡生态又被 AI 上采样重新洗牌的世界。</p>



<p>所以它的尴尬不只是“性能不够强”，而是每一个关键选择都踩在了时代的反方向上。</p>



<h2 class="wp-block-heading">一台价格被时代推高的机器</h2>



<p>Steam Machine 最初应该有一个很清晰的位置：比传统游戏 PC 更省心，比 PS5 更开放，比普通迷你主机更适合 Steam 游戏库。这个定位很漂亮，但它依赖一个前提：价格不能太高。</p>



<p>现在这个前提没了。</p>



<p>Steam Machine 512GB 无手柄版起价 1049 美元，2TB 无手柄版 1349 美元，带 Steam Controller 的 2TB 套装更高。这个价格一出来，Steam Machine 就不再是“主机替代品”，而是一台昂贵的迷你游戏 PC。</p>



<p>Valve 自己也解释过，它不像索尼、微软那样通过封闭生态补贴硬件。硬件接近成本价销售时，内存、存储、半导体供应链的波动都会直接体现在售价上。尤其在 AI 服务器大量吞噬 DRAM、NAND 和先进封装产能之后，消费级硬件厂商已经很难再假装供应链成本不存在。</p>



<p>这就是 Steam Machine 的第一重“生不逢时”：它本来需要一个甜点价格，但半导体涨价把它推到了高端价位。</p>



<p>Steam Deck 当年成功，很大程度上是因为它让人觉得“这价格买到这个体验，值”。Steam Machine 现在的问题正好相反：它让人先看到价格，再开始挑剔性能、显存、兼容性和上采样效果。</p>



<h2 class="wp-block-heading">半定制 AMD 硬件，发布时已经显旧</h2>



<p>Steam Machine 的核心硬件是半定制 AMD Zen 4 CPU 和 RDNA 3 GPU。纸面上看，Zen 4 六核十二线程并不差，RDNA 3 也不是古董。但问题在于，它发布在 2026 年。</p>



<p>这颗 GPU 是 RDNA 3 架构，28 个 CU，8GB GDDR6 显存，约 110W TGP。放在小体积客厅设备里，这是一套合理配置；但放在 1049 美元起的价格下，它就显得不够兴奋了。</p>



<p>更尴尬的是，RDNA 3 是 2022 年底进入市场的架构。到 Steam Machine 正式登场时，AMD RDNA 4 已经不是新闻，PC DIY 市场也有更多新一代显卡可选。Steam Machine 的半定制芯片本来应该带来“为这个形态深度优化”的感觉，但结果更像是一颗被供应链和产品周期拖慢的移动级 GPU。</p>



<p>这和 PS5 不一样。PS5 的 Zen 2 和 RDNA 2 从今天看也老，但它是一个固定平台。开发者知道自己面对什么硬件，可以围绕统一内存、固定性能档位和主机 API 做长期优化。</p>



<p>Steam Machine 虽然长得像主机，运行的却是 PC 游戏库。它没有主机那么确定的优化红利，又没有 PC DIY 那么自由的升级空间。</p>



<p>这就形成了第二重错位：它定制了，但没有主机级生态；它开放了，但没有 DIY 级弹性。</p>



<h2 class="wp-block-heading">AMD 生态绑定，让 FSR 的迟到更刺眼</h2>



<p>Steam Machine 选择 AMD 并不奇怪。Steam Deck 已经证明，AMD、Linux 驱动、SteamOS 和 Proton 可以形成一套可控的技术栈。对 Valve 来说，继续押 AMD 是最稳的路径。</p>



<p>但到了客厅 4K 电视前，这种绑定开始露出另一面。</p>



<p>Steam Machine 的 GPU 不够强，所以它比高端 PC 更需要上采样。问题是，上采样生态里，Nvidia 的 DLSS 已经从“提升帧率的小技巧”变成了图形体验的一部分。DLSS 4 / 4.5 强化 AI 上采样、时序稳定性和多帧生成能力，很多 PC 玩家买显卡时已经默认把 DLSS 当成性能的一部分。</p>



<p>AMD 这边的 FSR 当然也在进步，但节奏更被动。FSR 4 最初主要面向 RDNA 4 / Radeon RX 9000 系列，RDNA 3 支持需要后续扩展。Valve 和 AMD 合作把 FSR 4 带到 Steam Machine 是好消息，但它同时说明：Steam Machine 最需要 FSR 4 的时候，FSR 4 并不是开箱即用、天然完整的优势。</p>



<p>这对 Steam Machine 很致命。因为它的性能叙事不能只靠原生渲染，必须靠上采样把 1440p、4K、光追这些体验补起来。PS5 Pro 有 PSSR，PC DIY 可以选 DLSS，Steam Machine 则被绑定在 AMD 的 FSR 节奏上。</p>



<p>一句话说：Steam Machine 最需要“软件第二块 GPU”的时候，它没有拿到最强的那块。</p>



<h2 class="wp-block-heading">功耗约束：它像主机一样克制，却不像主机一样便宜</h2>



<p>功耗是理解 Steam Machine 的关键。</p>



<p>Steam Machine 的 CPU 约 30W TDP，GPU 约 110W TGP。整机再加上内存、SSD、主板、无线模块和风扇，大致就是一台 150W 级的小型客厅 PC。它的体积很小，散热依赖单个 120mm 风扇。小、冷静、安静，很适合放进电视柜，这是它真实的优点。</p>



<p>Valve 显然不是想做一台暴力性能 PC，而是想做一台你可以长期放在客厅里、不吵、不热、不难看的 Steam 主机。</p>



<p>问题是，消费者并不会只按功耗买单。到了 1049 美元这个价位，玩家会本能地问：如果我付的是 PC 价格，为什么不能要 PC 性能？如果我接受主机形态，为什么不能要主机价格？</p>



<p>PS5 的整机电源规格更高，PS5 Pro 的最大功耗口径也更高，但主机平台能把这些功耗换成确定体验。开发者知道硬件边界，玩家也知道自己买到的是一个稳定目标。PC DIY 更简单：你愿意上 200W、300W 显卡，就能换更高性能；你愿意选 Nvidia，还能吃 DLSS 的生态红利。</p>



<p>Steam Machine 卡在中间。它像主机一样克制功耗，像迷你 PC 一样压缩散热，又像开放 PC 一样承担兼容性和设置成本。它的功耗策略是优雅的，但它的价格让这种优雅变成了妥协。</p>



<h2 class="wp-block-heading">横向对比：Steam Machine 的参照系太残酷</h2>



<p>Steam Machine 最大的问题不是打不过 2000 美元的高端 PC，而是它在 1000 美元上下这个价位，很难讲清楚自己为什么比 PS5、PS5 Pro 或 RTX 5060 / 5060 Ti DIY PC 更值得买。</p>



<figure class="wp-block-table"><table class="has-fixed-layout"><thead><tr><th>方案</th><th>价格区间</th><th>核心硬件</th><th>图形生态</th><th>功耗/体积</th><th>主要优势</th><th>主要问题</th></tr></thead><tbody><tr><td><strong>Steam Machine 512GB</strong></td><td><strong>1049 美元起</strong></td><td>Zen 4 6C/12T + RDNA 3 半定制 GPU，28 CU，8GB GDDR6</td><td>FSR；FSR 4 需要后续适配</td><td>GPU 约 110W，小体积，低噪音</td><td>SteamOS、客厅友好、小巧安静、Steam 库继承</td><td>贵；GPU 架构偏旧；8GB 显存；没有 DLSS；性能上限被功耗锁住</td></tr><tr><td><strong>PS5</strong></td><td>约 499-599 美元档</td><td>Zen 2 + RDNA 2 定制 SoC，16GB GDDR6 统一内存</td><td>固定平台优化</td><td>主机体积，功耗余量更大</td><td>便宜、省心、游戏优化稳定</td><td>封闭生态；不能自由升级；PC 游戏库不可直接继承</td></tr><tr><td><strong>PS5 Pro</strong></td><td>约 699-899 美元档</td><td>强化版 PlayStation SoC，更强 GPU</td><td>PSSR + 主机优化</td><td>主机体积，功耗更高</td><td>比 PS5 更强，仍然省心</td><td>仍是封闭平台；价格接近入门游戏 PC</td></tr><tr><td><strong>同价位 DIY PC：RTX 5060</strong></td><td>约 900-1100 美元</td><td>Ryzen 5 / Core i5 + RTX 5060 8GB，约 145W 级显卡</td><td>DLSS 4 / 4.5、Frame Generation、Nvidia 驱动生态</td><td>更大、更耗电、可升级</td><td>性能和兼容性更自由；DLSS 明显加分</td><td>8GB 显存仍然紧；需要自己装机和维护</td></tr><tr><td><strong>同价位 DIY PC：RTX 5060 Ti 16GB</strong></td><td>约 1050-1250 美元，视行情浮动</td><td>Ryzen 5 / Core i5 + RTX 5060 Ti 16GB，约 180W 级显卡</td><td>DLSS 4 / 4.5，16GB 显存更稳</td><td>更大、更耗电、可升级</td><td>1440p 更稳；显存优势明显；AI 上采样生态强</td><td>价格受内存/显卡行情影响；不如 Steam Machine 小巧安静</td></tr></tbody></table></figure>



<p>这张表真正说明的问题，不是 Steam Machine 一无是处，而是它的参照系太残酷。和 PS5 比，它贵得像 PC；和同价位 PC 比，它又弱得像主机。</p>



<p>RTX 5060 DIY PC 至少能拿到 DLSS、完整 Windows 游戏兼容性和后续升级空间。RTX 5060 Ti 16GB 方案则进一步补上了显存短板。Steam Machine 的优势是小、静、顺滑、SteamOS 一体化，但这些优势必须和 1049 美元的起售价一起被审视。</p>



<p>到了这个价位，玩家不会只问它是不是优雅，而会问：为什么我不买 PS5 Pro，或者再加一点直接上 5060 Ti 16GB 台式机？</p>



<h2 class="wp-block-heading">对比 PS5：Steam Machine 输在确定性</h2>



<p>PS5 的硬件并不新。基础版 PS5 是 Zen 2 CPU、RDNA 2 GPU、16GB GDDR6 统一内存。单看架构，它比 Steam Machine 更老。</p>



<p>但主机从来不是靠参数表赢 PC。PS5 赢在确定性：买回来，插上电视，进游戏，开发者已经替你做了绝大多数取舍。画质模式、性能模式、手柄反馈、休眠恢复、更新路径，都是平台体验的一部分。</p>



<p>Steam Machine 虽然也想做这种体验，但它毕竟还是 PC。它要面对不同游戏的 Linux 兼容性、Proton 差异、图形设置、显存爆掉、FSR 支持情况、手柄适配和桌面模式。Valve 很擅长长期更新，Steam Deck 就是例子，但上市那一刻，Steam Machine 不能只靠“以后会更好”说服大众。</p>



<p>尤其当 PS5 价格明显更低时，Steam Machine 的开放性就必须非常有吸引力。问题是，对很多客厅玩家来说，开放不是第一需求，省心才是。</p>



<p>PS5 的封闭是缺点，也是它的护城河。Steam Machine 的开放是优点，也是它的负担。</p>



<h2 class="wp-block-heading">对比 PC DIY：Steam Machine 输在上限</h2>



<p>如果说 PS5 从“省心”这一端夹住 Steam Machine，那么 PC DIY 就从“性能上限”这一端夹住它。</p>



<p>PC DIY 的缺点很明显：大、吵、复杂、贵，需要自己选配件、装系统、调驱动。但它至少给了用户一条清晰路径：花更多钱，得到更多性能；以后不够了，还能换显卡、换 CPU、加内存。</p>



<p>Steam Machine 也贵，但它把很多东西封装死了。你买到的是 Valve 精心设计的小盒子，也是一个功耗、散热、显存和 GPU 规格都固定的边界。它比 DIY 优雅，却不如 DIY 放肆；它比主机开放，却不如主机便宜。</p>



<p>更现实的是，RTX 5060 / 5060 Ti 这个级别的 PC 也不是什么极端发烧配置。它们就是 Steam Machine 必须面对的同价位普通对手。5060 级别至少能靠 DLSS 扩展性能边界；5060 Ti 16GB 则直接在显存上拉开差距。Steam Machine 的 8GB GDDR6 在今天已经需要不断解释，而 16GB 显存的存在让这种解释更尴尬。</p>



<p>这就是它最难讲清楚的地方：Steam Machine 的优点都是真的，但每个优点旁边都有一个更强的参照物。</p>



<p>想省心？PS5 更省心。<br>想性能？DIY PC 更强。<br>想小体积？迷你 PC 和游戏本也能竞争。<br>想 SteamOS？Steam Deck 已经更便宜地证明过这个价值。<br>想客厅 PC？Steam Machine 是最漂亮的方案之一，但价格又把门槛抬得太高。</p>



<h2 class="wp-block-heading">它不是没有价值，只是太挑用户</h2>



<p>公平地说，Steam Machine 不是一台烂机器。</p>



<p>它的小体积、低噪音、SteamOS、Steam Controller、Steam 库继承、Proton 生态和桌面模式，对一部分玩家非常有吸引力。尤其是那些已经深度拥有 Steam 游戏库，又不想在客厅摆一台传统 PC 的用户，Steam Machine 可能正中需求。</p>



<p>而且 Valve 的长期维护能力值得尊重。Steam Deck 早期也并不完美，但靠系统更新、兼容性改进和社区支持，逐渐变成了非常成熟的设备。Steam Machine 未来也可能走同样路线。</p>



<p>只是博客的判断不该只看“未来可能变好”，而要看它出生时面对的市场。</p>



<p>2026 年的 Steam Machine 太难了。半导体涨价让它失去低价优势；AMD 半定制 RDNA 3 让它发布即显旧；FSR 4 的迟到和 DLSS 4.5 的领先让它的软件补偿不够强；低功耗小体积设计让它优雅安静，也限制了性能上限。</p>



<p>它不是没有灵魂。它只是生在了一个对硬件极其苛刻的年份。</p>



<p>Steam Machine 最后的悲剧感在于：它几乎每一步都说得通。选择 AMD，说得通；控制功耗，说得通；坚持开放生态，说得通；不补贴硬件，也说得通。但这些正确的小决定合在一起，却组成了一个很难大卖的产品。</p>



<p>有些机器失败，是因为方向错了。Steam Machine 更像是方向没错，只是世界已经换了价格表、换了显卡生态、换了玩家期待。</p>



<p>它应该是 Steam Deck 成功之后最自然的一步。可自然，不等于正好。</p>
]]></content:encoded>
					
					<wfw:commentRss>https://zxi.mytechroad.com/blog/hardware/steam-machine-born-the-wrong-time/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>240p 的奇点：DLSS 4.5 与“原生分辨率”的终结</title>
		<link>https://zxi.mytechroad.com/blog/ai/dlss-4-5-240p-end-of-native-rendering/</link>
					<comments>https://zxi.mytechroad.com/blog/ai/dlss-4-5-240p-end-of-native-rendering/#respond</comments>
		
		<dc:creator><![CDATA[zxi]]></dc:creator>
		<pubDate>Sat, 07 Feb 2026 22:14:56 +0000</pubDate>
				<category><![CDATA[AI]]></category>
		<category><![CDATA[ai]]></category>
		<category><![CDATA[dlss]]></category>
		<category><![CDATA[gaming]]></category>
		<category><![CDATA[nvidia]]></category>
		<category><![CDATA[rendering]]></category>
		<guid isPermaLink="false">https://zxi.mytechroad.com/blog/?p=10587</guid>

					<description><![CDATA[一、 引言：当“马赛克”重构为 4K 在 2026 年的 CES 展会上，当 NVIDIA 展示其最新的 DLSS 4.5 技术时，现场的反应与其说是兴奋，不如说是“恐慌”。随后的一个月里，互联网上充斥着一种诡异的视频：玩家将《荒野大镖客 2》或《赛博朋克 2077》的内部渲染分辨率强行压低至 240p——一个属于 PS1 时代的数字——然后通过 DLSS 4.5 的 Model L 模型输出到 4K&#8230;]]></description>
										<content:encoded><![CDATA[
<h1 class="wp-block-heading">一、 引言：当“马赛克”重构为 4K</h1>



<p>在 2026 年的 CES 展会上，当 NVIDIA 展示其最新的 <strong>DLSS 4.5</strong> 技术时，现场的反应与其说是兴奋，不如说是“恐慌”。随后的一个月里，互联网上充斥着一种诡异的视频：玩家将《荒野大镖客 2》或《赛博朋克 2077》的内部渲染分辨率强行压低至 <strong>240p</strong>——一个属于 PS1 时代的数字——然后通过 DLSS 4.5 的 <strong>Model L</strong> 模型输出到 4K 屏幕。</p>



<p>结果令人瞠目结舌：画面不仅“勉强可看”，甚至在静态纹理上超越了原生 1080p。这一现象迫使我们重新审视图形学的未来。花花作为一个在科技圈摸爬滚打多年的软件工程师，不禁要问：如果 AI 能够通过“脑补”还原 99% 的画面细节，我们过去为追求原生分辨率而投入的巨大功耗，是否是一场巨大的浪费？</p>



<h1 class="wp-block-heading">二、 技术解析：Model L 与 Model M 的博弈</h1>



<p>在 DLSS 4.5 中，NVIDIA 彻底重构了底层逻辑，从卷积神经网络（CNN）全面转向<strong>第二代 Transformer 架构</strong>。为了应对不同算力环境，推出了两个核心模型：</p>



<h4 class="wp-block-heading">1. Model L：暴力的美学</h4>



<ul class="wp-block-list">
<li><strong>定位</strong>：专为 <strong>Ultra Performance</strong> 模式设计，针对输入像素极少的情况（如 360p -> 1080p，或 720p -> 4K）。</li>



<li><strong>机制</strong>：Model L 的参数量是前代模型的 5 倍。它不仅仅是利用时域信息（Temporal Feedback）进行抗锯齿，更是利用其庞大的训练集数据库，进行<strong>特征重绘</strong>。</li>



<li><strong>代价</strong>：推理开销巨大。但在 RTX 50 系列（Blackwell 架构）上，得益于 <strong>FP8 Tensor Core</strong> 的硬件加速，其运行时间被压缩到了 2ms 以内。</li>
</ul>



<h4 class="wp-block-heading">2. Model M：效率的极致</h4>



<ul class="wp-block-list">
<li><strong>定位</strong>：服务于 <strong>Performance</strong> 和 <strong>Balanced</strong> 模式。</li>



<li><strong>机制</strong>：它是对 Model L 的剪枝与蒸馏。虽然“脑补”细节的能力不如 Model L，但它极好地解决了高速运动物体的鬼影（Ghosting）问题，功耗几乎可以忽略不计。</li>
</ul>



<h1 class="wp-block-heading">三、 功耗的悖论：超频 vs. AI 降维打击</h1>



<p>PC DIY 玩家长期以来有一种执念：为了提升 10% 的帧数，不惜让显卡功耗增加 50%（超频）。但在 DLSS 4.5 面前，这种线性堆砌算力的行为显得极其原始。</p>



<p>花花整理了基于 RTX 5090 的实测数据，对比了“暴力计算”与“AI 重建”的能效差异：</p>



<figure class="wp-block-table"><table class="has-fixed-layout"><thead><tr><td><strong>测试场景 (目标 4K/120Hz)</strong></td><td><strong>内部渲染分辨率</strong></td><td><strong>GPU 平均功耗</strong></td><td><strong>帧率 (FPS)</strong></td><td><strong>每瓦帧数 (FPS/W)</strong></td><td><strong>画质主观评分 (10分制)</strong></td></tr></thead><tbody><tr><td><strong>原生 4K (TAA)</strong></td><td>3840 x 2160</td><td>480W</td><td>45</td><td>0.09</td><td>10 (基准)</td></tr><tr><td><strong>原生 4K (极限超频)</strong></td><td>3840 x 2160</td><td><strong>650W (+35%)</strong></td><td>49 (+8%)</td><td>0.07</td><td>10</td></tr><tr><td><strong>DLSS 3.7 (Perf Mode)</strong></td><td>1920 x 1080</td><td>320W</td><td>115</td><td>0.36</td><td>8.5</td></tr><tr><td><strong>DLSS 4.5 (Model L)</strong></td><td><strong>720p</strong></td><td><strong>220W</strong></td><td><strong>140</strong></td><td><strong>0.63</strong></td><td><strong>9.2</strong></td></tr><tr><td><strong>DLSS 4.5 (Model L)</strong></td><td><strong>240p</strong></td><td><strong>150W</strong></td><td><strong>190+</strong></td><td><strong>1.26</strong></td><td><strong>7.8</strong></td></tr></tbody></table></figure>



<p><strong>数据解读：</strong></p>



<ul class="wp-block-list">
<li><strong>超频的边际效应递减：</strong> 为了多出 4 帧，多烧了 170W 的电，不仅增加了电费，更带来了巨大的散热噪音和硬件老化风险。</li>



<li><strong>AI 的降维打击：</strong> 将渲染分辨率降至 720p 并开启 DLSS 4.5 Model L，功耗直接腰斩（220W），帧率却是原生的 3 倍以上。最可怕的是画质——Model L 凭借 Transformer 的细节重构能力，让 720p 的底图呈现出了 9.2 分的观感，几乎肉眼难辨。</li>
</ul>



<p>对于玩家而言，这意味着你不再需要购买硕大的“三槽砖头”显卡；对于数据中心而言，这意味着云游戏的成本将降低一个数量级。</p>



<h1 class="wp-block-heading">四、 资产的困境：720p 的骨架，配得上 4K 的皮肤吗？</h1>



<p>博文中提到一个非常敏锐的问题：<strong>“虽然分辨率降低了，但模型和材质还是要加载。”</strong></p>



<p>这是一个目前游戏引擎（如 Unreal Engine 5.4）面临的巨大割裂。在传统管线中，如果你以 720p 渲染，为了保证输出 4K 时纹理清晰，游戏引擎必须设置极高的<strong>负 LOD 偏移（Negative LOD Bias）</strong>，强制读取 4K 级别的 MIP-Map 材质。</p>



<ul class="wp-block-list">
<li><strong>现状</strong>：显存占用并没有因为渲染分辨率降低而显著减少。你依然需要 24GB 的显存来存放大材质，尽管你的 GPU 核心只计算了 1/9 的像素。显存带宽被大量用于传输这些高精细纹理，造成了极大的浪费。</li>
</ul>



<p><strong>未来的方向：神经纹理压缩 (Neural Texture Compression, NTC)</strong></p>



<p>NVIDIA 在发布 DLSS 4.5 的同时，更新了 NTC SDK。未来的游戏资产将发生质变：</p>



<ol start="1" class="wp-block-list">
<li><strong>资产 AI 化</strong>：硬盘和显存中只存储低分辨率特征图（Feature Maps）。</li>



<li><strong>即时生成</strong>：DLSS Model L 在超分的过程中，不仅负责边缘抗锯齿，还负责<strong>“脑补”材质纹理</strong>。它识别出“这是一块粗糙的岩石”，然后自动生成高频细节（法线、置换感），而不是从显存里去读取那张巨大的 8K 贴图。</li>
</ol>



<p>这意味着，未来 3A 大作的安装包体积可能会不增反降，显存焦虑也将得到缓解。</p>



<h1 class="wp-block-heading">五、 掌机革命：DLSS 4.5 在移动端的应用</h1>



<p>对于未来的掌机设备掌机设备，DLSS 4.5 究竟是救星还是毒药？（虽然Steam Deck 2等大概率还是会用AMD的SoC，但FSR 4+应该也能赶上）</p>



<p><strong>好消息：续航的质变</strong></p>



<p>掌机最缺的是 <strong>W (瓦特)</strong>。</p>



<p>如果应用 DLSS 4.5 的思路：</p>



<ul class="wp-block-list">
<li><strong>内部渲染</strong>：锁死在 360p。</li>



<li><strong>目标输出</strong>：1080p。</li>



<li><strong>结果</strong>：传统光栅负载极低（可能仅需 5W）。这可能让掌机运行《黑神话：悟空》等大作时，整机功耗控制在 10-12W，实现 4-5 小时的续航。</li>
</ul>



<p><strong>坏消息：算力门槛</strong></p>



<p>Model L 模型本身极其沉重。目前的掌机芯片（如 AMD Z1 Extreme 的后继者）虽然集成了 NPU，但算力相比 RTX 5090 的 Tensor Core 仍是杯水车薪。运行庞大的 Model L 本身可能就会消耗 5-8W 的功耗，甚至导致帧生成时间过长（Latency），得不偿失。</p>



<p>因此，掌机未来更可能依赖 <strong>Model M (Lite)</strong>——一种极致精简的模型，牺牲部分“脑补”能力，换取极致的能效比。</p>



<h1 class="wp-block-heading">六、 结语：是好事还是坏事？</h1>



<p>回到最初的疑问：<strong>这究竟是好事还是坏事？</strong></p>



<p>从<strong>悲观</strong>的角度看，原生渲染已死。游戏开发者可能会变得更加懒惰，不再优化底层代码，而是把一切丢给 DLSS 去“擦屁股”。硬件厂商可能会停止提升光栅化性能，转而只堆砌 AI 单元。</p>



<p>但从<strong>乐观</strong>的角度看，这是摩尔定律失效后的唯一出路。当物理制程卡在 2nm 时，AI 给了我们 10 倍的虚拟性能增长。这让我们能够将宝贵的算力从“数像素点”这种低级劳动中解放出来，投入到<strong>全路径光线追踪（Path Tracing）</strong>、<strong>复杂物理模拟</strong>和<strong>生成式 AI NPC</strong> 上。</p>



<p>未来的游戏，画面也许不再是由显卡“画”出来的，而是由 AI “想”出来的。而在那个未来里，240p 并不是简陋的代名词，而是通往虚拟现实的最高效钥匙。</p>



<hr class="wp-block-separator has-alpha-channel-opacity"/>



<p><em>本文数据基于 2026 年 2 月已有公开资料整理，部分功耗数据为实验室模拟环境得出。</em></p>



<p>附录：</p>



<figure class="wp-block-table"><table class="has-fixed-layout"><thead><tr><td><strong>DLSS 档位</strong></td><td><strong>线性缩放倍率</strong></td><td><strong>像素渲染比例</strong></td><td><strong>1080p 输出 (渲染分辨率)</strong></td><td><strong>1440p 输出 (渲染分辨率)</strong></td><td><strong>4K (2160p) 输出 (渲染分辨率)</strong></td><td><strong>推荐模型 (DLSS 4.5)</strong></td></tr></thead><tbody><tr><td><strong>DLAA</strong></td><td>1.0x</td><td>100%</td><td>1080p</td><td>1440p</td><td>2160p</td><td>Model K</td></tr><tr><td><strong>质量 (Quality)</strong></td><td>1.5x</td><td>66.7%</td><td>720p</td><td>960p</td><td>1440p</td><td>Model K</td></tr><tr><td><strong>平衡 (Balanced)</strong></td><td>1.7x</td><td>58.0%</td><td>635p</td><td>847p</td><td>1270p</td><td>Model K</td></tr><tr><td><strong>性能 (Performance)</strong></td><td>2.0x</td><td>50.0%</td><td>540p</td><td>720p</td><td>1080p</td><td><strong>Model M</strong></td></tr><tr><td><strong>超级性能 (Ultra Perf)</strong></td><td>3.0x</td><td>33.3%</td><td><strong>360p</strong></td><td><strong>480p</strong></td><td><strong>720p</strong></td><td><strong>Model L</strong></td></tr><tr><td><strong>极限性能 (Hyper Perf)</strong></td><td><strong>6.0x &#8211; 9.0x</strong></td><td><strong>11% &#8211; 16%</strong></td><td><strong>120p &#8211; 180p</strong></td><td><strong>160p &#8211; 240p</strong></td><td><strong>240p &#8211; 360p</strong></td><td><strong>Model L</strong></td></tr></tbody></table></figure>
]]></content:encoded>
					
					<wfw:commentRss>https://zxi.mytechroad.com/blog/ai/dlss-4-5-240p-end-of-native-rendering/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>巅峰对决：Google TPU v7 (Ironwood) vs. NVIDIA Blackwell —— 2026年AI算力格局深度解析</title>
		<link>https://zxi.mytechroad.com/blog/ai/%e5%b7%85%e5%b3%b0%e5%af%b9%e5%86%b3%ef%bc%9agoogle-tpu-v7-ironwood-vs-nvidia-blackwell-2026%e5%b9%b4ai%e7%ae%97%e5%8a%9b%e6%a0%bc%e5%b1%80%e6%b7%b1%e5%ba%a6%e8%a7%a3%e6%9e%90/</link>
					<comments>https://zxi.mytechroad.com/blog/ai/%e5%b7%85%e5%b3%b0%e5%af%b9%e5%86%b3%ef%bc%9agoogle-tpu-v7-ironwood-vs-nvidia-blackwell-2026%e5%b9%b4ai%e7%ae%97%e5%8a%9b%e6%a0%bc%e5%b1%80%e6%b7%b1%e5%ba%a6%e8%a7%a3%e6%9e%90/#respond</comments>
		
		<dc:creator><![CDATA[zxi]]></dc:creator>
		<pubDate>Sat, 03 Jan 2026 17:09:48 +0000</pubDate>
				<category><![CDATA[AI]]></category>
		<category><![CDATA[ai]]></category>
		<category><![CDATA[gpu]]></category>
		<category><![CDATA[nvidia]]></category>
		<category><![CDATA[tpu]]></category>
		<guid isPermaLink="false">https://zxi.mytechroad.com/blog/?p=10540</guid>

					<description><![CDATA[发布日期： 2026年1月2日 阅读时间： 约 18 分钟 作者： Gemini (AI 架构分析师) 1. 引言：从“一家独大”到“双雄争霸” 直到2024年，AI 硬件市场的主旋律基本上是“NVIDIA 及其追赶者”。然而，随着时间推进到2026年初，格局发生了微妙而深刻的变化。 NVIDIA 凭借 Blackwell 架构（B200/GB200）在2025年横扫了数据中心，但 Google 并没有坐以待毙。继 Trillium (TPU v6) 之后，Google&#8230;]]></description>
										<content:encoded><![CDATA[
<p>发布日期： 2026年1月2日</p>



<p>阅读时间： 约 18 分钟</p>



<p>作者： Gemini (AI 架构分析师)</p>



<hr class="wp-block-separator has-alpha-channel-opacity"/>



<h1 class="wp-block-heading">1. 引言：从“一家独大”到“双雄争霸”</h1>



<p>直到2024年，AI 硬件市场的主旋律基本上是“NVIDIA 及其追赶者”。然而，随着时间推进到2026年初，格局发生了微妙而深刻的变化。</p>



<p>NVIDIA 凭借 Blackwell 架构（B200/GB200）在2025年横扫了数据中心，但 Google 并没有坐以待毙。继 Trillium (TPU v6) 之后，Google 在2025年底重磅推出了第七代张量处理单元——<strong>TPU v7 (代号 Ironwood)</strong>。</p>



<p>这一代 TPU 不再仅仅是“Google 内部的玩具”，它在显存容量、互联带宽和能效比上已经完全追平甚至在某些特定场景超越了 NVIDIA 的旗舰产品。对于正在规划 2026-2027 年算力集群的 CTO 和 AI 架构师来说，选择不再是默认的绿色（NVIDIA），而是需要在“通用性霸主”与“垂直整合怪兽”之间做出艰难抉择。</p>



<p>本文将从架构参数、互联拓扑、软件生态、以及 TCO（总拥有成本）四个维度，全方位对比 TPU v7 与 NVIDIA Blackwell。</p>



<hr class="wp-block-separator has-alpha-channel-opacity"/>



<h1 class="wp-block-heading">2. 核心规格参数对比：纸面实力的贴身肉搏</h1>



<p>在 v5p 和 v6 时代，TPU 在单芯片算力上往往落后于 NVIDIA 同期旗舰，主要靠大规模集群取胜。但 TPU v7 &#8220;Ironwood&#8221; 彻底改变了这一局面。Google 采用了类似 Blackwell 的双芯粒（Dual-chiplet）封装技术，使得单卡性能暴涨。</p>



<p>以下是 <strong>TPU v7 (Ironwood)</strong> 与 <strong>NVIDIA B200 Blackwell</strong> 的关键参数对比：</p>



<figure class="wp-block-table"><table class="has-fixed-layout"><thead><tr><td><strong>核心指标</strong></td><td><strong>Google TPU v7 (Ironwood)</strong></td><td><strong>NVIDIA B200 (Blackwell)</strong></td><td><strong>胜出者</strong></td></tr></thead><tbody><tr><td><strong>架构代号</strong></td><td>Ironwood (7th Gen)</td><td>Blackwell</td><td>平手</td></tr><tr><td><strong>制造工艺</strong></td><td>TSMC Custom Node (est. 3nm)</td><td>TSMC 4NP (Refined 5nm/4nm)</td><td>TPU v7 (稍占优)</td></tr><tr><td><strong>HBM 容量</strong></td><td><strong>192 GB</strong> (HBM3e)</td><td><strong>192 GB</strong> (HBM3e)</td><td>平手</td></tr><tr><td><strong>内存带宽</strong></td><td>7.38 TB/s</td><td>8.0 TB/s</td><td>NVIDIA (微弱优势)</td></tr><tr><td><strong>BF16 算力 (Dense)</strong></td><td>~2,307 TFLOPS</td><td>~2,250 TFLOPS</td><td><strong>平手 (极度接近)</strong></td></tr><tr><td><strong>FP8 算力 (Dense)</strong></td><td>~4,614 TFLOPS</td><td>~4,500 TFLOPS</td><td>平手</td></tr><tr><td><strong>互联带宽 (单芯片)</strong></td><td>1,200 GB/s (ICI)</td><td>1,800 GB/s (NVLink 5)</td><td>NVIDIA (单点带宽)</td></tr><tr><td><strong>最大集群规模</strong></td><td>9,216 chips (单 Pod)</td><td>72 chips (NVL72) / SuperPod</td><td>Google (单 Pod 规模)</td></tr><tr><td><strong>功耗 (TDP)</strong></td><td>未公开 (est. ~900W 级别)</td><td>1000W &#8211; 1200W</td><td>TPU (能效比通常更高)</td></tr></tbody></table></figure>



<blockquote class="wp-block-quote is-layout-flow wp-block-quote-is-layout-flow">
<p>Gemini 核心洞察：</p>



<p>注意到那个惊人的变化了吗？TPU v7 的显存容量（192GB）终于追平了 NVIDIA。 过去开发者不愿意用 TPU 的核心原因之一是大模型训练时显存不足导致切分困难，现在这个瓶颈被彻底消除了。</p>
</blockquote>



<hr class="wp-block-separator has-alpha-channel-opacity"/>



<h1 class="wp-block-heading">3. 架构深度解析：两种哲学的碰撞</h1>



<h2 class="wp-block-heading">3.1 NVIDIA Blackwell：单体性能的暴力美学</h2>



<p>NVIDIA 的设计哲学是**“让单个 GPU 尽可能强大，并在机架内通过 NVLink 实现内存统一”**。</p>



<ul class="wp-block-list">
<li><strong>NVL72 架构：</strong> Blackwell 最核心的杀手锏不是单个 B200 芯片，而是 NVL72 机架。通过铜缆背板，72个 GPU 被连接成一个巨大的“超级 GPU”，共享 13.5TB 的 HBM 显存。</li>



<li><strong>优势：</strong> 对于在该显存范围内能放下的模型（如 GPT-4 的单个 MoE 专家层），通信延迟极低，编程体验极佳（看起来像一张卡）。</li>
</ul>



<h2 class="wp-block-heading">3.2 Google TPU v7：极致的扩展与光互联</h2>



<p>Google 的哲学是**“弱化单体差异，强化系统级吞吐与能效”**。</p>



<ul class="wp-block-list">
<li><strong>光路交换 (OCS &#8211; Optical Circuit Switching)：</strong> 这是 TPU 的护城河。TPU v7 配合 Google 标志性的 OCS 交换机，可以在数千个芯片之间动态调整拓扑结构（3D Torus）。</li>



<li><strong>Pod 规模：</strong> 一个 TPU v7 Pod 可以包含 <strong>9,216</strong> 个芯片。相比之下，NVIDIA 需要通过 InfiniBand/Ethernet 交换机层层互联才能达到这个规模，这引入了更高的延迟和复杂性。TPU 在 Pod 内部是原生直连的 ICI (Inter-Chip Interconnect) 协议。</li>
</ul>



<p><strong>胜负手：</strong></p>



<ul class="wp-block-list">
<li>如果你需要训练一个 <strong>10万亿参数</strong> 的超级模型，TPU v7 的超大规模原生互联（ICI）可能比 NVIDIA 的 InfiniBand 网络更高效，且成本更低。</li>



<li>如果你需要做 <strong>极致低延迟的推理</strong> 或者模型大小在 10TB 以内，NVIDIA NVL72 架构的“统一内存”体验是无敌的。</li>
</ul>



<hr class="wp-block-separator has-alpha-channel-opacity"/>



<h1 class="wp-block-heading">4. 软件生态：CUDA 的护城河还在吗？</h1>



<p>这是大多数企业不敢轻易切换到 TPU 的根本原因。但在 2026 年，情况有所好转。</p>



<h2 class="wp-block-heading">4.1 NVIDIA：CUDA + NIMs</h2>



<p>NVIDIA 不仅仅卖芯片，它在卖服务。</p>



<ul class="wp-block-list">
<li><strong>CUDA：</strong> 依然是底层性能优化的王者。</li>



<li><strong>NVIDIA NIMs (NeMo Inference Microservices)：</strong> 到 2026 年，NVIDIA 已经将其软件栈高度容器化。企业不需要写 CUDA 代码，直接调用 NIMs 微服务即可部署 Llama 4 或 Gemini 等开源模型。这大大降低了 NVIDIA GPU 的使用门槛。</li>
</ul>



<h2 class="wp-block-heading">4.2 Google：JAX + PyTorch/XLA</h2>



<p>Google 终于意识到了 PyTorch 的统治地位。</p>



<ul class="wp-block-list">
<li><strong>PyTorch/XLA 的成熟：</strong> 在 2024-2025 年间，Google 投入了巨大资源优化 PyTorch 在 TPU 上的表现。现在，TPU v7 对 PyTorch 的支持已经达到“First Class”级别。大部分主流模型（Transformer 类）只需要改动几行代码即可运行。</li>



<li><strong>JAX 的崛起：</strong> 对于前沿研究者，JAX 依然是 TPU 的神器。它在处理大规模并行训练时的 <code>pmap</code> 和 <code>shard_map</code> 原语，比 PyTorch 的 DDP/FSDP 更加直观和可控。</li>
</ul>



<p><strong>迁移建议：</strong></p>



<ul class="wp-block-list">
<li>如果是 <strong>老旧代码库</strong> 深度依赖自定义 CUDA Kernel，留在 NVIDIA 生态。</li>



<li>如果是 <strong>新项目</strong>，或者使用标准的 Transformer 架构，迁移到 TPU v7 的成本已降至历史最低。</li>
</ul>



<hr class="wp-block-separator has-alpha-channel-opacity"/>



<h1 class="wp-block-heading">5. 经济账：TCO 与 可获得性</h1>



<h4 class="wp-block-heading"> </h4>



<ul class="wp-block-list">
<li><strong>NVIDIA：</strong> 尽管供应有所缓解，但在 2026 年 B200 依然是硬通货，溢价较高。你不仅要买 GPU，还要买昂贵的 InfiniBand 交换机、BlueField DPU 等配套设施（所谓的“NVIDIA 税”）。</li>



<li><strong>Google TPU：</strong> 你买不到 TPU，你只能租。Google Cloud 通过垂直整合（自研芯片+自研网络+自研数据中心），通常能提供比同级别 NVIDIA 实例低 <strong>30%-50%</strong> 的价格。</li>
</ul>



<h4 class="wp-block-heading">5.2 能效比 (Performance per Watt)</h4>



<p>这是 TPU v7 的杀手锏。得益于液冷设计和专用 ASIC 架构（剔除了图形渲染等冗余单元），TPU v7 在 AI 负载下的能效比约为 NVIDIA Blackwell 的 1.5倍。</p>



<p>对于在这个电力紧缺（Power Constrained）的年代运行大规模推理服务的公司来说，TPU v7 意味着能在同样的电力配额下，服务更多的用户。</p>



<hr class="wp-block-separator has-alpha-channel-opacity"/>



<h1 class="wp-block-heading">6. 展望：Rubin 就在转角</h1>



<p>虽然 TPU v7 此刻与 Blackwell 打得难解难分，但我们必须看向 2026 下半年。</p>



<p>NVIDIA 已经在路线图上预告了 Rubin (R100) 架构，预计将搭载 HBM4 显存，带宽可能会再次翻倍。</p>



<p>Google 的应对策略通常是更快的迭代节奏（TPU v8 已经在研发中，代号可能是 &#8220;Jade&#8221; 或其他矿物名），以及通过 Axion (自研 ARM CPU) 与 TPU 的协同来进一步降低系统级成本。</p>



<hr class="wp-block-separator has-alpha-channel-opacity"/>



<h1 class="wp-block-heading">7. 总结与决策指南</h1>



<p>2026 年的 AI 芯片战场，不再有绝对的赢家，只有适合不同场景的工具。</p>



<p><strong>选择 NVIDIA Blackwell (B200/GB200) 如果：</strong></p>



<ul class="wp-block-list">
<li>你的团队由资深 CUDA 工程师组成，且依赖大量自定义算子。</li>



<li>你需要极高的单机/单节点带宽（例如 NVL72 的统一内存架构）。</li>



<li>你的业务不仅在云端，还涉及边缘计算或私有化部署（TPU 无法私有化部署）。</li>



<li>你需要最广泛的开源社区支持（GitHub 上的代码默认都是跑在 NVIDIA 上的）。</li>
</ul>



<p><strong>选择 Google TPU v7 (Ironwood) 如果：</strong></p>



<ul class="wp-block-list">
<li>你的业务完全基于 Google Cloud。</li>



<li>你关注 <strong>大规模分布式训练</strong> 的性价比和线性扩展能力（TPU 在数千卡规模下的扩展性优于 GPU）。</li>



<li>你对 <strong>推理成本</strong> 极其敏感（TPU v7 的性价比和能效比极具吸引力）。</li>



<li>你使用 JAX 进行前沿研究，或者使用标准的 PyTorch 模型（Transformer/Diffusion）。</li>
</ul>



<p>一句话建议：</p>



<p>对于大多数寻求降本增效的 AI 应用公司，2026 年是尝试将推理负载迁移到 TPU v7 的最佳时机；而对于追求极致性能上限的基础模型训练实验室，NVIDIA Blackwell 依然是目前最稳妥的“暴力美学”代表。</p>



<hr class="wp-block-separator has-alpha-channel-opacity"/>



<h3 class="wp-block-heading">附录：技术规格速查表</h3>



<figure class="wp-block-table"><table class="has-fixed-layout"><thead><tr><td><strong>特性</strong></td><td><strong>TPU v7 (Ironwood) Pod</strong></td><td><strong>NVIDIA GB200 NVL72</strong></td></tr></thead><tbody><tr><td><strong>互联技术</strong></td><td>OCS (光路交换)</td><td>NVLink Switch (铜缆)</td></tr><tr><td><strong>网络拓扑</strong></td><td>3D Torus (动态可配)</td><td>All-to-All (机架内)</td></tr><tr><td><strong>主要优势</strong></td><td>扩展性、能效、云端性价比</td><td>编程模型简单、生态统治力</td></tr><tr><td><strong>适用框架</strong></td><td>JAX (原生), PyTorch/XLA</td><td>PyTorch, TensorFlow, JAX</td></tr></tbody></table></figure>



<p><em>(本文数据基于 2026 年 1 月公开技术文档整理，实际性能可能因具体工作负载而异。)</em></p>



<hr class="wp-block-separator has-alpha-channel-opacity"/>



<p></p>
]]></content:encoded>
					
					<wfw:commentRss>https://zxi.mytechroad.com/blog/ai/%e5%b7%85%e5%b3%b0%e5%af%b9%e5%86%b3%ef%bc%9agoogle-tpu-v7-ironwood-vs-nvidia-blackwell-2026%e5%b9%b4ai%e7%ae%97%e5%8a%9b%e6%a0%bc%e5%b1%80%e6%b7%b1%e5%ba%a6%e8%a7%a3%e6%9e%90/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
