一张让客户沉默的账单
上个月 OpenAI 宣布 API 涨价 30%,我手机里好几个客户群同时炸开了。
其中一个做内容工具的客户,之前每月 API 费用稳定在一万左右。涨价之后,同样的调用量,账单变成了 13000。他跟我说,这还没算 Claude 和 Gemini 那边也在涨。
我帮他拉了一张 12 个月的成本预测表。如果继续用 API,按当前增速,明年这时候月成本会到 15000 以上。12 个月累计接近 13 万。
而如果一次性投入 18000 买一台 A100 服务器,自己跑 Qwen-72B,第一个月投入高,但从第二个月开始,月成本只有电费和维护,大概 2000 块。三个月回本,12 个月累计 4 万出头。

这张表拉完,他沉默了大概十秒钟。然后问了我一个问题:开源模型真的能替代 GPT-4 吗?
这个问题问到了关键。不是钱的问题,是能力的问题。
中小企业用不上超大模型,不是用不上推理
很多讨论把「大模型」和「推理能力」混为一谈,好像不用 GPT-4 就等于不用 AI。这个理解是错的。
中小企业的典型场景是什么?客服问答、商品文案、订单异常检测、库存预警、数据提取。这些全是推理任务,但需要的不是 128K 上下文窗口,不是复杂数学推理,不是多模态生成。
需要的是:领域知识 + 中等参数模型 + 低成本推理。

我帮几个客户做过对比测试。在客服提取和商品文案这两个场景,Qwen-72B 经过 RAG 和 LoRA 微调之后,准确率比 GPT-4o 高 8% 到 12%。原因很简单:GPT-4o 没有读过这个客户的内部知识库,但微调后的 Qwen 读过。
更关键的是成本。GPT-4o 处理 100 万 token 大概 5 美元,Qwen-72B 私有化部署之后,同样的推理量,电费成本不到 0.5 美元。差了整整一个数量级。
所以问题不是「用不用得起大模型」,而是「你的场景到底需要多大的模型」。对中小企业来说,7B 到 72B 的开源模型,配合 RAG 和微调,已经覆盖了 80% 以上的业务场景。
工具链要轻量化、垂直化,不是回归 SaaS
说完模型,说说工具。
很多人一听「私有化部署」,就觉得要招一个算法团队,要从零搭一套基础设施。这个顾虑是真实的,但解决方式不是「回归 SaaS」,而是「工具链的轻量化和垂直化」。
SaaS 和私有化部署是矛盾的。模型在本地跑,工具在云端,数据还得来回传,那私有化就没有意义了。
中小企业真正需要的是一套「开箱即用」的私有化方案。包括:
一个轻量的 RAG 框架,能读取内部文档和数据库;一个可视化的知识库管理界面,业务人员自己就能上传文档、调整切分策略;一个低门槛的微调工具,用 LoRA 或者 QLoRA,用几百条标注数据就能把模型调教到比通用 API 还好用。
这些工具本身可以是开源的、本地部署的,但交互设计要像 SaaS 一样简单。不是回归 SaaS,是「私有化部署 + SaaS 级别的用户体验」。
我目前在给客户做方案时,基本不会推荐从 0 开始搭建。而是基于开源框架(比如 vLLM + LangChain + 自研的业务适配层),在一周内完成从 0 到可用。核心思路是:模型能力不是壁垒,部署效率和领域适配才是。
成本是核心动力,供应商锁定是隐藏焦虑
说回成本。
数据安全当然是一个考虑因素,特别是对医疗、金融、政务这些有明确合规要求的行业。但对大多数中小企业来说,成本才是第一决策因素,数据安全是必要条件,供应商锁定是隐藏焦虑。
供应商锁定这件事,很多企业还没意识到严重性。
OpenAI 涨价只是开始。未来还可能区域封锁(某些地区 API 不可用)、功能限制(某些能力只给大客户)、模型断代(旧模型下线,被迫迁移)。你的业务逻辑建立在别人的定价策略上,这个风险比大多数人想象的大。
把模型能力攥在自己手里,本质是把定价权和选择权从别人手里拿回来。这个逻辑和云计算早期「要不要自建机房」的讨论很像。结论是:不是所有人都要自建,但所有人都该有「能自建」的选项。
模型正在变成 commodity
最后说一个很多人没注意到的趋势。
Llama 3、Qwen 2.5、DeepSeek-V2 的能力已经快速追平 GPT-4 的 80% 场景。模型本身正在从「稀缺技术」变成「基础设施」,就像云服务器一样。
这意味着什么?
意味着企业不需要为「模型有多强」付费,只需要为「把模型跑起来并调教好」付费。模型的护城河不在模型本身,而在部署效率和领域适配。
DeepSeek 的崛起已经证明了这个趋势。一个中国团队做的开源模型,推理成本只有 GPT-4 的 1/10,能力却在快速逼近。这不是个例,是方向。
对我做企业 Agent 落地的影响也很直接。以前跟客户聊方案,要先解释「为什么用 AI」,现在变成了「用哪套模型、怎么部署、怎么微调」。AI 已经从「要不要用」变成了「怎么用最省」。
结尾
所以回到开头那个客户的问题:开源模型真的能替代 GPT-4 吗?
我的答案是:看你的场景。如果你的场景是写小说、做科研、写复杂代码,那 GPT-4 目前还是最好的。但如果你的场景是客服问答、商品文案、数据提取、经营分析,那一个经过微调的 72B 开源模型,效果可能更好,成本可能只有 1/10。
模型在贬值,部署能力在升值。这个判断,是我接下来一年做企业 Agent 落地的基本假设。
如果你也在算这笔账,想聊聊私有化部署的路径和成本,扫码加微信,备注「Agent咨询」。