TOPIC · 旧机利旧

先看这三项前提,再决定买不买新卡——旧服务器利旧跑大模型的完整清单

旧服务器能不能跑大模型?多数能。本页讲清显存档位×模型规模×并发人数的对照逻辑、利旧的三项前提(驱动、内存、存储IO)、什么时候必须加卡,以及按实机出具的实测记录怎么拿。存量服务器和显卡先用足,跑量化模型,先诊断再出方案,评估不收费。

直接回答

多数情况下,跑得动——前提是量化模型、场景对路

结论先行:近几年的存量服务器,配上量化模型,多数能支撑知识库问答、文书初稿这类私有化推理场景;中小企业场景我们实测过,旧电脑就能起步。

量化模型是利旧的技术基础:把模型权重从高精度压到低精度,用可控的效果折损换显存占用大幅下降,老硬件因此装得下新一代模型。JAVIS 的做法一直是「存量服务器和显卡先用足,跑量化模型」,顺序是先诊断再出方案,不做「推荐您买新卡」的方案。

芯片覆盖面不用担心:AMD、NVIDIA、昇腾、寒武纪、海光芯片均支持,JAVIS 原生支持国产信创系统,国产卡可支撑 70B 级模型私有化推理。即便利旧后确需补充算力,也有国产化路线可选,能与采购的信创要求对齐。

为什么坚持在内网旧服务器上跑,而不是上云?保密法第三十一条明确涉密系统必须与互联网物理隔离;数据安全法对核心数据违规最高可处一千万元罚款。模型和知识库跑在单位内网、断网可用,利旧同时满足成本与合规两头。

对照逻辑

显存×模型规模×并发人数:先看逻辑,表按实机出

对照逻辑分三层:显存档位决定装得下多大的模型,模型规模决定任务效果的上限,并发人数决定一台机器够几个人同时用。三个变量缺一个,表就不成立。

网上流传不少「多少 GB 显存能跑多少 B 模型」的通用对照表。这类表只能当方向参考——量化精度不同、上下文长度不同、并发人数不同,同一个显存档位的结论会差出很多——上下文越长、并发越多,KV 缓存吃掉的显存越多,能装的模型就越小。

所以我们不在本页贴一张通用数值表。表要对着您的实机出:评估时按您的实际显存档位、目标场景和并发人数盘点,给出「能跑什么规模的量化模型、支撑多少人同时用、瓶颈卡在哪」的对照表,白纸黑字写进方案书,每一行您都能核对、能复算。

利旧清单

利旧的三项前提:驱动、内存、存储 IO

结论:三项都过关,利旧基本成立;哪一项不过关,先补哪一项,而不是急着买新卡。

① 驱动与算力生态。 先确认机器里的卡是 AMD、NVIDIA 还是昇腾、寒武纪、海光——这些芯片 JAVIS 均支持,但驱动版本要与推理框架配套。这是利旧最常卡住的一步,必须在评估时实机验证,不能只看参数表。

② 系统内存。 量化后模型权重体积下降,但推理时仍有相当部分开销落在内存侧;内存不足会直接拖慢甚至跑不起来。评估时我们会核对内存容量与通道配置是否匹配目标模型规模。

③ 存储 IO。 模型加载和知识库检索都是重 IO 操作,机械盘和固态盘的差距直接体现在响应速度上。旧服务器还在用机械盘的,换一块固态盘往往比加一张新卡性价比高得多。

三项过关后进入选型:按场景选模型规模,按并发定部署形态——不是越大越好,是越合适越好。

实测口径

实测记录:按您的实机出具,不预先贴数字

已验证的结论:旧电脑就能起步——这是中小企业场景(律所、咨询、设计、诊所)的实测结果。

很多人想在决策前看到「某型号旧服务器跑 32B 量化模型的速度」。我们的做法是:实测记录将在评估时按您的实机出具。原因很工程化——速度数字离开实机没有意义,同一个模型在不同显卡、不同驱动、不同并发下表现差出成倍;贴一个孤立数字让您当基准去对,对不上反而两头费时间。

评估阶段我们会在您的设备上真跑一遍:实测速度与体验当场记录、写进方案,可复算、可复跑。也可以约 30 分钟远程接入演示(脱敏数据),全程无外网请求。

至于客户案例:受合规约束,我们不以任何形式披露客户单位信息。真实效果请通过远程接入演示验证,或带着贵单位的真题来当场复跑。

扩容判断

什么时候必须加卡:并发、长上下文、多模态

结论:三种情况利旧通常不够用——并发人数超出单机承载、长上下文场景、多模态需求;其余情况,先利旧跑通再说。

① 并发。 使用人数上量后,单机吞吐会成为瓶颈,表现为排队和响应变慢。这时按并发人数测算扩容规模,而不是拍脑袋加卡。

② 长上下文。 几百页的卷宗、整本制度汇编的交叉比对,上下文越长显存占用越高,对存量机器压力最大。

③ 多模态。 图片、表格识别等 OCR 密集场景需要额外算力,纯文本利旧达标不代表多模态也达标。

扩展路径固定为两步:先利旧跑通、试点验收见效,再按需扩容。扩容时国产卡可支撑 70B 级模型私有化推理,信创与性能两条路线都能走,按贵单位采购要求配置。

起步方式

怎么起步:一次免费评估,或一份 AI 内网体检

结论:先做 40 分钟免费评估——现有设备能跑什么、缺什么、多少钱、多久能用,白纸黑字,不满意不立项。

评估不收费,不附带采购义务。我们交付的是可复算的账单:报价每一行您都能核对,方案书逐项写明网络边界、日志、权限、模型调用、第三方组件与更新方式。

想先把内网底子摸清的单位,可以选 AI 内网体检,分 ¥0、¥999、¥2,999 三档,档位内容以官网产品页为准;体检报告同样遵循「先诊断再出方案」的口径。

最后一句实在话:上来就让您买新卡的方案,建议多留个心眼。存量设备先用足,试点见效再扩容——这是我们对自己的约束,也建议您用它来检验任何一家供应商。

FAQ · 常见疑问

六个最常问的问题,答案先行。

几年前的旧服务器还能跑大模型吗?
多数能跑起来。量化模型大幅降低了显存门槛,中小企业场景我们实测过旧电脑就能起步;您这台具体行不行,取决于驱动、内存、存储 IO 三项前提,评估时实机验证,不做纸面推断。
多少显存能跑多大的模型?
按「显存档位×模型规模×并发人数」三者对照判断,单看显存会误判。我们不发布通用数值表——评估时按您的实机和目标场景出对照表,写进方案书,可逐行核对。
你们会推荐我们买新卡吗?
不会,我们的顺序是先诊断再出方案,不做「推荐您买新卡」的方案。存量服务器和显卡先用足、跑量化模型;只有并发、长上下文或多模态确实超出存量承载时,才谈按需扩容,且国产卡可支撑 70B 级模型私有化推理,扩容也有信创路线可选。
旧服务器跑大模型,数据合规吗?
合规,前提是部署在单位自有内网。保密法第三十一条明确涉密系统必须与互联网物理隔离,数据安全法对核心数据违规最高可处一千万元罚款;机悟的模型与知识库全部跑在单位内部,断网可用,演示全程无外网请求,可当场复验。
支持国产芯片和信创系统吗?
支持。AMD、NVIDIA、昇腾、寒武纪、海光芯片均支持,JAVIS 原生支持国产信创系统;有国产化要求的单位按其采购要求配置,具体适配组合以评估结论为准。
评估收费吗?怎么开始?
免费。一次 40 分钟评估,讲清现有设备能跑什么、缺什么、多少钱、多久能用,不满意不立项;需深入摸底可选 AI 内网体检(¥0/¥999/¥2,999 三档),也可约 30 分钟远程演示在您的设备上真跑一遍。

先看您那台机器能跑什么,再谈买不买新卡。

存量服务器和显卡先用足,跑量化模型;上来就让您买新卡的方案,建议多留个心眼。