日本AI黑马Fugu杀出:7B小模型如何叫板Fable与Mythos?
AI 摘要
一句话摘要: 日本Sakana AI的7B参数模型Fugu通过多智能体编排架构在工程基准测试中超越GPT-5.5等大模型。 关键事实: Fugu Ultra在SWE-Bench Pro和TerminalBench 2.1上分别得分73.7和82.1,超越GPT-5.5和Claude Opus 4.8, Fugu核心是7B参数的RL Conductor模型,作为“包工头”动态调度GPT-5、Claude等大模型完成任务, Fugu的架构依赖美国大厂API,存在底层依赖风险和延迟问题 涉及主体: Sakana AI, Llion Jones, David Ha, NVIDIA, Google, Fugu, Fable 5, Mythos Preview, GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro 可能影响: 可能推动AI行业从“参数竞赛”转向“编排架构”创新,降低算力门槛,但多智能体系统的API依赖性和延迟问题可能限制其在实时场景的应用。 是否值得继续跟踪: 是,因为Fugu展示了小模型通过编排实现高性能的可行路径,可能改变AI模型开发范式,但其商业化和稳定性需观察。 噪音/炒作风险: 中,因为跑分对比存在争议(与Fable和Mythos非同池实测),且架构依赖外部API,但实际测试中代码审查和长会话稳定性表现真实,有一定技术价值。