AI资讯

OpenAI用GPT-5.6 Sol自我优化,推理成本最高降20%

智能摘要

利用效率。公司称,系统会按地域、可用容量和加速器类型分配请求;集群内部还会参考负载、上下文长度、缓存可用性等因素分发任务。分析生产流量、识别负载失衡来源、测试路由策略并调整启发式规则。内核。附上相关截图如下:编写内核的正确性。token,再由主模型验证或修正预测结果。

用AI优化AI自己

在2026年7月29日, OpenAI发布了博文, 宣称要用GPT – 5.6 Sol模型去优化GPT – 5.6系列自身的推理链路, 这套方案可使得端到端服务成本最多削减20%, 与此同时token生成效率提升超过了15%, 简而言之, 就是让AI自行给自己做手术, 从而把运行效率提升起来, 将要账单降低下去。

成本降在哪

GPT – 5.6系列七月九日推出, 是OpenAI眼下最强的模型, 然而强大的模型运行起来费用高深, 官方团队察觉到在推理这个环节存在大量的浪费现象。GPT – 5.6 Sol凭借Codex剖析生产方面的流量, 找出负载失去平衡的源头, 测试各种各样不同的路由策略, 随后再去调整启发式规则。系统会依据地域可以运用的容量和加速器类型来分配请求, 集群内部还会参照负载、上下文长度、缓存可用之处等一众因素来分发任务。

内核优化是关键

在模型向前传播的这个环节当中, GPT – 5.6 Sol能够辨别出来哪些计算是能够预先进行计算的, 哪些是能够避免掉的, 哪些又是能够进行并行处理的。它借助Codex自主去改写、优化生产进程里的GPU内核, 从而使得代码运行得既越发快速又越发节省资源。团队促使GPT -, 5.6 Sol去学习Triton和Gluon这两种编程语言, 其专门用于优化推理引擎内核, 这一步骤直接让端到端服务成本降低了最多20%。

正确性有保障

靠谱与否是得看AI自身所编写的代码吗, OpenAI运用了名为FpSan的具开源性质的工具, 也就是所谓的浮点数清理器, 据此去对GPT – 5.6 Sol编制内核的正确性开展验证活动, 这样的一整套验证流程能够保证经优化过后的代码, 在数学层面不存在问题现象, 不会因为节省成本而致使输出质量有所牺牲, 有着在生产环境当中运行该东西的情况, 安全性始终都是占据排行首位位置的。

推测性解码提速

OpenAI用GPT-5.6 Sol自我优化,推理成本最高降20%

优化推测性解码技术的是GPT-5.6 Sol。由较小的草稿模型先对下一个token进行预测的便是这项加速方案。之后再由主模型对该结果予以验证或者修正。得到优化以后。token生成效率有超过15%的提升。这意味着用户等待响应的时长较短。并且GPU的利用率较高。一台机器能够为更多请求提供服务。

对用户意味着什么

在那些运用GPT – 5.6系列API的开发者而言, 成本降低会径直在账单里体现出来。就普通用户来讲, 响应速度变得更快, 使用感受更为流畅。OpenAI于2026年7月29日的公开帖文当中证实了这些改进数据, 表明这套自优化方案已然落实到生产环境之中, 并非实验室里的概念验证。

你认为, AI靠自身优化此种途径, 在将来有没有可能把推理成本再度削减一半呢? 欢迎于评论区域交流你的见解, 若觉有价值便点个赞, 并且分享给身旁从事AI开发的友人。

相关文章