FLock 发布 THIS / THAT 模型 1.1(“这那模型”)。据团队公布的测试数据,新版模型在 1,710 道复杂决策测试中的成功率由 40.6% 提升至 77.5%,高于同期的 GLM-5.3、Kimi K3 以及 DeepSeek V4.1 Flash、V4 Pro;在此前的 68 道决策测试中,该模型则全部答对。
在测试涵盖的 19 类任务中,有 4 类任务的成功率同时超过 GPT-5.6 和 Claude Opus 5,另有 2 类达到 100% 的成功率,追平两款模型中的最佳成绩。其中,“预算内选择最优组合”专项的成功率为 67.8%,约为 GPT-5.6 的 4 倍、Claude Opus 5 的 5 倍。不过,这些优势仅体现在相关专项任务中,不代表模型的通用能力排名。
新版本仍保持 18.8 亿参数规模、零生成 Token,测试延迟约为 30.9 毫秒。团队表示,此次性能提升主要来自训练数据优化,而非扩大模型规模。据其介绍,FLock 在 1.0 版本发布仅一天后便推出 1.1 升级,在模型规模与推理延迟不变的情况下实现了显著的性能跃升。