本报讯 (记者袁传玺)
8月6日,PPIO正式推出智能模型网关新功能Fusion融合模型。该模型与仅做简单请求转发的传统API网关不同,Fusion融合模型会将每次调用变成一场“专家会诊”——网关会将复杂任务同时分发给多个各有所长的“专家模型”并行作答,再通过思考编排与交叉验证,由主模型融合生成最终答案。

企业供图
Fusion模型以智能优先、兼顾性价比:通过工程化的融合手段,把回答质量稳定在头部旗舰模型梯队,同时把成本控制在中低梯队。在DRACO深度研究基准测试中,PPIO用三个开源模型融合后的评分超越了ClaudeFable5,而成本仅为后者的十分之一。
Fusion融合模型证明,智能的提升不再只发生在参数层,它也可以发生在调用层。
Fusion融合模型就是用户发送一次请求,网关在内部组织多个模型各自独立作答,再将这些答案经过筛选和融合后返回一份最终回复。
市面上常见的API网关做的是转发,请求进来,选一条线路发出去,网关本身不改变答案的质量。PPIO智能模型网关在转发之外增加了一层编排,让多个模型的产出在返回之前经过比对和融合,因此网关本身成为智能增量的来源。
一次完整的Fusion融合模型调用在网关内部走四步。其中第三步决定融合的质量。多个模型给出一致结论的地方互相印证,降低了偏科带来的盲区;出现冲突的地方被标记出来进一步推敲,为拦截幻觉提供了第二视角;不同推理路径汇总后覆盖面大于任何一条单独路径,补上了单模型视角遗漏的部分。经过这一步整理,主模型定稿时面对的信息量远大于原始问题本身,因此融合结果的质量高于其中任何一个参考模型的单独作答。
由于多个模型同时执行,等待时间取决于最慢的一个,不会随模型数量线性增长,因此引入更多视角并不意味着成倍增加延迟。同时,某个模型调用失败时网关会跳过该模型继续完成融合,多路径的结构反而让整条链路比单模型调用更抗抖动。在Agent的多轮交互中,同一回合内已获得的参考结果会被复用,避免重复消耗Token,所以实际成本增幅远低于“调用了多个模型”这个直觉判断。每次调用经过的模型、消耗的Token、耗时和成本全部留痕可查,使得智能水平的变化可度量、可追溯。
值得关注的是,在2026年世界人工智能大会(WAIC)期间,PPIO联合创始人兼CEO姚欣提出了Agent时代的核心公式:Agent生产力=Token智能密度×AgentLoop时长。
Token智能密度决定Agent每一步决策的质量上限,AgentLoop时长决定它能持续运行多久、完成多复杂的任务。过去提升Token智能密度,只能被动等下一代模型发布。但是现在,模型的选择权在使用者手里,没有人会被绑死在某一个模型上。PPIOFusion融合模型在调用层做编排提升智能密度,让用户无感实现智能的提升。
规模上这套能力已经过验证。截至2026年6月,PPIO日均Token调用量超1.2万亿,较2025年同期增长超8倍。根据灼识咨询统计,在中国独立AI云计算服务提供商中,PPIO日均Token消耗量排名第一。今年PPIO入选中国信通院首批“企业级Token服务性能攀登基线”,通用场景下跑出TPS≥55个/秒、TTFT≤0.9秒、调用成功率≥99.9%的指标。
让大模型从“用得起”走向“用得聪明”,让大模型从“单智能”走向“融合智能”,这是PPIO智能模型网关正在做的事。
(编辑 张文玲)