飞致云在2026年7月发布1Panel AI一体机产品家族,并且正在持续完善和丰富该产品系列。1Panel AI一体机以类“超融合”理念整合底层算力、模型服务和AI应用,帮助企业以更低的成本构建安全、可控、可持续运营的本地AI基础设施。如果说4卡NVIDIA RTX Pro 5000部署DeepSeek-V4-Flash模型是1Panel AI一体机产品家族中的“旗舰档”,那么搭载NVIDIA GB10 Grace Blackwell芯片的1Panel AI一体机则在入门级别有效降低了私有化AI基础设施建设的门槛。
日前,1Panel AI一体机产品家族推出了“双GB10”版本,该设备能够私有化部署DeepSeek-V4-Flash模型,内置企业级AI网关,支持水平扩容,为企业用户提供了入门级AI基础设施建设的新选择。
1Panel AI一体机(双GB10版)内置两个GB10算力节点,GB10为NVIDIA和联发科联合研发的Grace Blackwell超级芯片,包含一颗Blackwell GPU、一颗Grace CPU和128GB统一内存。本文为您介绍在1Panel AI一体机(双GB10版)私有化部署DeepSeek-V4-Flash模型的具体方案、压测数据和实测表现。
在为期两周的实际测试后,我们体会到这是一场算力与带宽的博弈。本文意在还原实测体验,探讨1Panel AI一体机(双GB10版)部署DeepSeek-V4-Flash后适合与不适合的应用场景,以及如何测算合理的投入产出。
一、GB10算力和带宽的博弈
在解读实测数据之前,有必要先认清GB10这颗“心脏”的独特个性。搭载了GB10的设备是一台不折不扣的算力“小钢炮”,但在大模型推理的世界里,模型能跑多快(TPS,tokens/s)同时受到算力和显存带宽的限制,属于典型的木桶效应。
先说算力。GB10搭载一颗“CPU+GPU”二合一的2.5D封装SoC(System on Chip),CPU为20核ARM处理器,GPU基于Blackwell架构,搭载第五代Tensor Core和超过6000个CUDA Core,原生支持FP4、FP8等精度格式,合计提供约1 PFLOP(FP4稀疏峰值算力)。单看账面数字,这样的配备完全不输主流企业级加速卡,对于DeepSeek‑V4‑Flash这类原生FP4‑MoE稀疏专家模型可以直接加载权重,不需要软件转译,能够释放完整FP4算力。
再看带宽。GB10采用LPDDR5X统一内存,128GB容量足够应对多数模型,但带宽约为273GB/s。大模型解码(Decode)阶段,属于典型的带宽密集型负载:稠密模型每生成一个Token,需要读取全部模型权重;而MoE稀疏模型每次仅读取少量被激活的专家权重。因此MoE稀疏模型对带宽的压力远小于同等总参数量的稠密模型。算力再强,如果带宽跟不上,GPU也只能原地等待数据“投喂”,算力资源被白白闲置。
需要指出的是,DeepSeek-V4-Flash这类MoE模型在解码阶段对带宽的需求,实际上远小于同规模的稠密模型,这为算力与带宽的博弈留下了转机。而这也正是博弈的起点:GB10的算力相对“富余”,带宽相对“短缺”。 在预填充(Prefill)阶段,任务以计算为主,GB10可以充分释放算力峰值;而一旦进入解码阶段,带宽便成为不可逾越的天花板,算力利用率会明显被压低。理解这一对矛盾,是读懂后续所有实测数据的关键前提。
二、双GB10版部署DeepSeek-V4-Flash方案
在进入实测之前,我们先来看看1Panel AI一体机(双GB10版)的“基本盘”。其相关配备参数和部署参数如下:
■ 设备:1Panel AI一体机(双GB10版)
■ 算力节点:2个GB10算力节点
■ 合计显存:256GB LPDDR5x统一内存
■ 合计算力:2 PFLOP FP4稀疏峰值算力
■ 合计存储:4TB NVMe SSD固态硬盘
■ 组网互联:200Gbps ConnectX高速网络
■ 模型精度:官方原生FP8+FP4混合精度
■ 推理引擎:vLLM
■ 管理软件:1Panel企业版(内置AI网关)
我们看到,1Panel AI一体机(双GB10版)提供的256GB统一内存总量,能够完整承载DeepSeek-V4-Flash的模型权重。与“旗舰档”4卡/8卡方案动辄数百GB显存的配备相比,256GB统一内存仍属“紧凑型”配置,上下文窗口长度、KV Cache分配和并发路数需要更精细地规划与调优。2个GB10算力节点通过200Gbps ConnectX高速网络互联,通信带宽足以支撑多节点协同推理与张量并行的数据传输需求。
在系统管理方面,1Panel企业版提供企业级AI网关,天然具备统一路由、负载均衡和限流能力,扩容时网关层无需推倒重来,能够大幅降低分布式部署的运维复杂度。
▲图1 1Panel AI一体机(双GB10版)
三、性能实测
我们将DeepSeek-V4-Flash模型部署至双GB10节点,覆盖五类业务场景进行全场景压测,并且叠加两周真实生产环境验证。我们观察的核心指标包括首字延时、整机输出吞吐、人均输出吞吐、WorkBuddy场景表现,以及温度与功耗表现。
本轮测试的场景及档位设计如下:
*口径说明:服务最大模型长度配置为1M,开启Prefix Cache。其中短对话、文档问答、长文档总结/RAG、通用复杂任务场景为无缓存命中,智能体/编程的Prefix Cache命中率为90%。
1. 首字延时(TTFT,单位:秒)
首字延时由预填充(Prefill)阶段主导,而预填充是算力密集型任务。GB10的Blackwell算力在这里发挥出了价值,预填充速度可达1500~2000 tokens/s。我们看到,短上下文场景表现最优,超长上下文、智能体/编程场景压力大。随着并发数的提升,所有场景首字延时都会上涨,而上下文越长,首字延时恶化速度越快。
▲图2 首字延时趋势
2. 整机输出吞吐TPS(tokens/s)
整机输出吞吐代表设备的总产能。解码阶段带宽密集,带宽直接决定了吞吐的物理上限。在实测中,短/中/长/超长上下文业务,整机峰值吞吐可以达到100‑120 tokens/s区间。而智能体/编程任务受模型逻辑、多轮工具调用影响,整体吞吐明显低于普通问答场景。
▲图3 整机输出吞吐趋势
4. 人均输出吞吐TPS(tokens/s)
人均TPS,即每个并发用户实际拿到的Token生成速度,直接决定每个人对话时打字流出的快慢。实测显示,并发数越低,单用户速度越快。并发用户越多,算力资源被分摊,每个用户的Token生成速度快速下降。当并发为1时,各类业务单用户速度都很高。随着并发的增加,所有场景人均Token生成速率同步下滑。智能体/编程场景衰减更加明显。该曲线可以用来评估一体机能够支持多少个同时在线对话用户,保障可接受的对话流畅度。
▲图4 人均输出吞吐趋势
5. WorkBuddy场景表现
压测数据还原的是双GB10的“极限能力”,但企业最终要的是“真实场景能不能用”。为此,我们将1Panel AI一体机(双GB10版)接入WorkBuddy办公智能体,进行了为期两周的真实生产环境验证,覆盖销售运营、方案撰写、会议纪要、邮件处理等典型办公负载。在典型2并发的办公场景下,实测结果如下:
■ 总输出吞吐TPS:大于60 tokens/s;
■ 运行状态:长时间稳定运行、无崩溃现象发生。
这一结果对应前文标准压测中整机输出吞吐稳定在60 tokens/s以上,说明双GB10节点在真实办公负载下能够协同工作、各司其职。对于把AI作为“桌面生产力工具”的中小团队,这一表现已经足以支撑日常的文档问答、内容生成与工作流调用等任务。
6. 功耗及散热表现
对于7×24小时长时间运行的企业设备,功耗与散热是绕不开的运维账。1Panel AI一体机(双GB10版)在两周持续验证期间的实测数据如下:
■ 整机功耗:低于80W;
■ GPU温度:低于70°C。
整机低于80W的功耗,设备无需进行独立机房散热改造,放在办公室即可运行。年化电费也仅数百元量级,而电费支出是总体拥有成本(TCO)里容易被忽略、却实实在在的一笔账。
四、选型建议与适用边界
从企业采购方的角度出发,评估一台设备是否值得投入,标准是非常明确的,即“它能否以可接受的成本,稳定地覆盖真实的业务需求”。 基于两周的持续验证与全场景压测,我们对考察1Panel AI一体机(双GB10版)的用户给出如下建议:
1. 适合的采购场景
■ 数据敏感、预算受限的中小团队,希望以低门槛搭建本地私有化AI基础设施,跑通“数据不出域”的合规闭环;
■ 为WorkBuddy AI办公提供本地算力支撑,缓解Token焦虑,降低使用成本;
■ 需要离线批处理“副机”的技术部门,用于夜间自动化测试、知识库建索引、文档批量总结、日志分析等吞吐优先任务。
2. 不适合的场景
■ 承载全团队实时交互式AI日常任务时(例如智能客服、办公助手等),GB10的首字延时与人均输出吞吐难以满足秒级回复的体感要求;
■ 超高并发、超长上下文的重负载场景,内存带宽消耗很快见顶;
■ 需要严格SLA(服务水平协议)保障的关键业务,需另行评估冗余与容灾能力。
最后,总结一下我们对1Panel AI一体机(双GB10版)实测的感受。
算力与带宽的博弈,本质是定位的博弈。1Panel AI一体机(双GB10版)部署DeepSeek-V4-Flash的真实体验,可以浓缩为一句话:该机型用消费级的门槛,交付了中端水准的算力。但带宽的瓶颈,决定了它是一台“专精特工”,而非“全能主力”。说到底,在大模型的世界里,“快”其实由两段拼接而成,其中算力决定首字延时,带宽决定输出速度。而AI一体机的选型,关键不是它的账面参数有多漂亮,而是它是否恰好匹配你业务的瓶颈。用对场景,才算物尽其用。