腾讯云突然杀价!DeepSeek-V4模型明天起狂降,最高直砍97.5%

2026年06月02日

腾讯云今天凌晨发布公告,DeepSeek-V4系列模型API调用价格即日起下调,部分输入场景降幅达97.5%。这不是一次试探性微调,而是面向开发者和企业客户的实质性让利在推理成本持续成为大模型落地瓶颈的当下,价格松动比参数堆叠更直接影响产品能否跑通商业闭环。

降价不是孤立动作,而是算力供给结构变化的信号

DeepSeek-V4此前由DeepSeek平台提供托管服务,腾讯云作为首批深度集成方,承担了大量推理节点部署与优化工作。本次调价背后,是腾讯云自研推理引擎Triton-TC(Tencent Cloud Optimized Triton)完成V4全量适配,单位token推理延迟下降38%,GPU显存占用压缩至原方案的61%。这意味着同样一张A100卡,可并发承载更多请求,摊薄单次调用成本。降价幅度差异也印证了技术路径:

1. 输入长度≤2K token的轻量级调用,价格从0.02元/千token降至0.0005元/千token;

2. 2K-8K区间维持0.002元/千token,较原价下降87%;

3. 超长上下文(8K-32K)未降价,但开放按实际使用token计费,取消最低计费单位门槛;

4. 所有调用默认启用KV Cache复用与FlashAttention-3加速,无需额外配置。

开发者真正关心的不是“降了多少”,而是“能不能稳住”

价格下调常伴随服务降级风险,但腾讯云此次同步升级SLA:

1. 99.95%可用性承诺覆盖全部V4接口(含streaming模式);

2. 首次引入“推理毛刺率”指标(<0.3%),指单次响应中出现超时重试或token生成中断的比例;

3. 新增实时用量仪表盘,支持按模型版本、输入长度、地域维度拆解成本构成,避免隐性费用。

别只盯着价格,三个实操细节决定你省不省钱

很多团队调用后发现账单没明显下降,问题往往出在使用方式:

1. 关闭冗余system prompt实测显示,含200字以上通用指令的system message会使首token延迟增加110ms,间接拉高超时重试率;

2. 合理设置max_tokensV4在输出长度超过设定值时仍会继续生成,直至自然截断,造成无效token计费;

3. 优先选用region-local endpoint上海节点调用上海部署的V4实例,平均RT比跨域调用低42ms,对高频小请求尤为关键。

这次降价没有附带任何绑定条件,不强制迁移至腾讯云其他AI服务,也不要求签署年度框架协议。它更像是基础设施层的一次压力释放:当模型能力趋近平台化,竞争焦点就从“谁家模型更强”转向“谁能让模型更安静、更便宜、更确定地运转”。

以上是腾讯云DeepSeek-V4降价背后的工程逻辑与实操要点,希望对你有所帮助。

免责申明:本站部分作品是由网友自主投稿和发布、编辑整理上传,对此类作品本站仅提供交流,不为其版权负责。如果您发现网站上有侵犯您的版权,请与我们取得联系,我们会及时修改或删除。

叙述跨境独立站搭建
嗨,想咨询什么业务?
深色
顶部