   
热mcp服务器
液冷GPU系统的物理引擎,作为AI可调用的MCP服务器公开。 让克劳德为H100集群确定冷却系统的尺寸,优化冷板流速,或比较水与乙二醇,并获得由手工验证的热模型支持的第一性原理答案。
快速开始
立即尝试 --打开 Colab中的交互式笔记本 以交互方式运行NVL72机架尺寸、拓扑比较和流量优化。
安装并用作MCP服务器:
pip install thermal-mcp-server添加到MCP客户端配置(claude_desktop_config.json 克劳德桌面版):
{
"mcpServers": {
"thermal": {
"command": "python",
"args": ["-m", "thermal_mcp_server"]
}
}
}注: Claude Desktop不继承您的shellPATH。如果上述方法不起作用,请使用Python二进制文件的绝对路径(例如。/usr/local/bin/python或者virtualenv内部的路径)。
配置后,直接向Claude工程部门提问:
*“我有8个H100 SXM GPU,每个700 W,每个冷板8 LPM的水冷,25°C的电源。结温和热裕度是多少?”*
*“在8 LPM的700 W负载下,比较水和50/50乙二醇。”*
*“为并联歧管中的8个H100 GPU确定CDU的尺寸——总流量、系统ΔP和回水温度。”*
克劳德调用相关工具,解释物理学,并在上下文中回答。
*克劳德桌面通话 analyze_coldplate 通过MCP服务器。用户提出自然语言热问题;克劳德选择了正确的工具,运行了物理学,并解释了结果。*
示例:H100 SXM基线
这是手动计算验证的参考案例——每个中间值(雷诺数、努塞尔特数、对流系数、压降)都在 tests/test_physics_behavior.py.
from thermal_mcp_server.physics import analyze
from thermal_mcp_server.schemas import AnalyzeColdplateInput
result = analyze(AnalyzeColdplateInput(
heat_load_w=700, flow_rate_lpm=8.0, inlet_temp_c=25.0, coolant="water"
))
print(f"Junction temp: {result.junction_temp_c:.1f}°C") # 70.9°C
print(f"Thermal margin: {83 - result.junction_temp_c:.1f}°C below throttle onset")
print(f"Flow regime: {result.regime}") # transitional (Re ≈ 3734)
print(f"Pressure drop: {result.pressure_drop_pa:.0f} Pa") # 16800 Pa (0.17 bar)有关机架规模分析(NVL72 CDU尺寸、串联与并联拓扑、1200 W时的B200),请参阅 交互式笔记本.
工具
四个MCP工具,每个都可以作为Python函数使用:
| 工具 | 它做什么 |
|---|---|
analyze_coldplate | 单点热工+水力分析:Tj、电阻击穿、ΔP、工况、泵功率 |
compare_coolants | 在相同条件下,水与乙二醇并排 |
optimize_flow_rate | 二分查找满足Tj目标的最小流量 |
analyze_rack | N个相同的GPU串联或并联:最大Tj、每个GPU的温度、总流量、系统ΔP、CDU返回温度 |
看 docs/mcp.md 用于完整的输入/输出模式。
运作原理
物理引擎将冷板建模为1D热阻网络:
T_junction = T_inlet + Q × (R_jc + R_tim + R_base + R_conv) + ΔT_coolant/2- R_jc/R_tim: 封装电阻(芯片制造商规格或估计)
- R_base: 铜基导电(几何形状+k=385 W/m·k)
- R_conv: 强制对流——Dittus Boelter(湍流)或Nu=4.36(层流),通过过渡线性混合(Re 2300-4000)
- ΔP : Darcy Weisbach与Blasius摩擦系数相同,过渡混合物
机架级模型以串联(累积温升)或并联(均匀入口、分流)拓扑堆叠N个单GPU分析。
flowchart LR
A["Input\nchip power, flow,\ncoolant, geometry"] --> B["Physics Engine\nDittus-Boelter · Darcy-Weisbach\nR_total network"]
B --> C["Output\nT_junction · ΔP\nthermal margin · pump power"]看 docs/physics.md 获取包括方程和假设在内的完整物理文档。
验证
根据公布的芯片规格进行模型输出。所有运行均使用25°C入口的水冷却液。
| 芯片 | TDP | Tj设计天花板 | Tj型号 | 边距 | 注释 |
|---|---|---|---|---|---|
| H100 SXM | 700 W | 83°C | 70.9摄氏度 8 LPM | 12.1°C | 默认几何形状;手工计算验证 |
| MI300X | 750 W | ~85°C(代理) | 74.2摄氏度 在8 LPM | ~10°C | AMD不发布Tj_max |
| B200 NVL72 | 1200 W | ~75°C(测试) | 75.0摄氏度 在9.3 LPM/GPU | 0°C时,极限 | R_jc=0.02 K/W est。;NVIDIA不发布 |
| 高迪3 OAM | 900 W(空气)/1200 W(液体) | ~85°C(代理) | 需要B200级几何形状 | -- | 默认H100几何形状尺寸小于1200 W |
关于B200和高迪3号: 英伟达和英特尔没有公布这些芯片的冷板几何形状或R_jc。B200分析使用工程估算。视为指示性;真正的规模需要供应商数据。
芯片来源: NVIDIA H100产品介绍 · 英伟达GB200 NVL72 · 半分析B200热估算 · AMD MI300X产品介绍 · 英特尔高迪3产品简介
已知限制
这些是明确记录的,因为它们约束了模型可以和不能告诉你的内容:
- 无歧管或集管压力损失 --机架ΔP仅为冷板。实际系统ΔP应增加20-50%的歧管损失。
- 无异构机架 --所有GPU都假设相同的TDP、几何形状和热阻。
- 仅稳态 --没有瞬态热电容。
- 单点流体特性 --标称温度为25°C时,水和乙醇50的性能保持不变。
- 无流量分配不均 --假设所有冷板上都有均匀的流动。
发展
git clone https://github.com/riccardovietri/thermal-mcp-server.git
cd thermal-mcp-server
uv sync --group dev
uv run pytest -v # all tests should pass路线图
- 交互式演示抛光 --扩大 Colab笔记本 具有灵敏度输出和更清晰的漫游
- 投资回报率计算器 --空气和液体之间的年度冷却成本增量、CDU投资回收期、每个GPU的冷却成本
