OpenAI猛掏自家芯片!叫“墨西哥辣椒”,9个月就干出来

2026年06月26日

OpenAI最近公开了一款自研芯片,代号“墨西哥辣椒”,从立项到流片仅用九个月。这个时间尺度在通用大模型公司自研硬件的历史上极为罕见,也打破了外界对AI公司重软件轻硬件的惯性认知。

为什么是现在?

过去几年,OpenAI持续依赖英伟达A100、H100等第三方加速卡训练和部署模型。随着模型参数量突破万亿级、推理请求并发数激增,通用GPU在能效比、内存带宽、定制化通信协议等方面逐渐显露出瓶颈。尤其在服务端推理场景中,固定结构的通用计算单元导致大量算力闲置,单位token成本难以深入下探。

“墨西哥辣椒”的核心定位

这款芯片并非用于训练超大规模模型,而是专为推理优化设计。其架构围绕三个关键路径展开:高带宽片上互联、低延迟KV缓存访问、以及针对Transformer解码阶段的稀疏激活调度单元。

1. 采用台积电N3E工艺节点,晶体管密度较前代提升约35%;

2. 集成8组独立计算单元,每组配备专用SRAM缓存与动态电压频率调节模块;

3. 支持FP16/BF16/INT8混合精度运算,并内置轻量级量化感知训练后端接口;

4. 片间互联带宽达每秒1.2TB,支持最多16颗芯片直连构建推理集群。

与传统方案的差异点

不同于谷歌TPU或亚马逊Trainium的全栈封闭路线,“墨西哥辣椒”在物理层保持PCIe 5.0兼容性,软件栈则深度适配OpenAI自有推理框架Orca。这意味着它既能嵌入现有服务器机架,又无需重构上层服务逻辑。

1. 推理吞吐量较同功耗级别GPU提升约42%,主要来自KV缓存命中率优化;

2. 单次生成响应延迟降低27%,尤其在长上下文(32K tokens以上)场景优势明显;

3. 故障恢复机制内置于硬件微码中,异常中断平均恢复时间缩短至毫秒级。

量产节奏与落地路径

目前该芯片已完成首轮硅验证,小批量试产芯片已部署于部分内部API服务节点。根据内部技术白皮书披露,正式量产版本将在未来两个季度内完成可靠性测试,并优先用于ChatGPT Pro与Enterprise API的高频调用链路。

1. 第一阶段覆盖全部文本生成类API流量的15%;

2. 第二阶段将扩展至多模态推理中的视觉编码子任务;

3. 第三阶段计划开放部分硬件抽象层接口,供特定合作伙伴做定向优化。

以上是OpenAI“墨西哥辣椒”芯片的技术轮廓与阶段性进展。如果您有相关疑问或想了解更多关于AI硬件协同设计的实际约束与工程取舍,建议关注后续发布的架构文档与能效实测报告。

免责申明:本站部分作品是由网友自主投稿和发布、编辑整理上传,对此类作品本站仅提供交流,不为其版权负责。如果您发现网站上有侵犯您的版权,请与我们取得联系,我们会及时修改或删除。

叙述跨境独立站搭建
嗨,想咨询什么业务?
深色
顶部