4.K3的代码审查查得全,更胜OPUS,也接近GPT5.6-SOL
代码审查比较复杂,也涉及了6种语言,所以样本量高达105个。
审查要求:
105样本:
结果:
代码当中,K3比GLM的质量更高,但是对于GPT而言,有一 个档位差距。
但也是最接近GPT的国产模型。
独家命中K3有4个,GLM为0 。
查得全方面,K3查到了40个,比GLM要多14个。
K3唯独不好的精度过低。
具体的K3 和GPT的差別就在于C/Go,K3 在 C++ 上虽赢了 GPT(7/12 vs 6/12,并列全场最高),但 C 和 Go 被屠,8/18 vs 17/18、9/18 vs 17/18,两门语言就输掉 17 个命中。
但K3的性价比最高,所以稳排二。
KIMI-K3 是本次 6 模型 × 6 语言 × 4 维度评测中,唯一在全部四个维度综合榜都进前二的模型(协作第一 0.803、代码生成第一0.867、代码调试 第二0.786、代码审查第二0.547),也是四个维度的单任务成本冠军(¥0.068 / ¥0.0216 / ¥0.0289 / ¥0.083),全场最省。
并且是 6 模型里唯一全 6 语言全程跑完、0 空响应的(GLM 在最难样本上反复超时,代码审查只能降到 HIGH 档才跑完),输出一致性 94% 也明显好于 GLM 的 83%,这得益K3的长任务稳定性,长跑不掉。
还有不知道就说不知道,6 个"敢说不知道"陷阱全过,不瞎编,因为坦诚 100%。由于KIMI K3质量够用甚至顶级 + 效率全场碾压,你会发现在综合分 = 50% 质量 + 50% 效率的真实性价比对比之下,没有任何对手能同时守住四条战线。
经过多轮的边用边测的情况下,K3已经可以不与GLM5.2搭配使用,可以自己独当一面。
KIMI K3是便宜大杯的"执行型"高手,写得了规范高质的代码、能啃最难的 bug,但需要你跟它沟通讨论(澄清率 0%,从不反问)、替它把关(抗带偏 67% → 你给它的"纠正"必须靠谱)。
K 3是既接近GPT的协作,又接近FABLE的代码生成深度,更有自己的一「纠」独秀调试能力。
另外,要提醒的是单用KIMI API,会很不划算,建议购买KIMI 套餐更划算。