要約
GPT-5.6 LunaとGPT-6 Astraのコードレビュー性能を比較した結果が発表されました。Lunaは、入力トークンが1百万あたり0.20ドル、出力トークンが1百万あたり1.20ドルで、50件のプルリクエストに対して69件の検証済みバグを見つけました。一方、Astraは10ドルの入力トークンと50ドルの出力トークンで、92件のバグを検出しました。Lunaのコストは総額0.20ドルで、Astraは5.66ドルかかりました。
この比較は、コストパフォーマンスの観点から非常に興味深い結果を示しています。Lunaは、コストあたりの検証済みバグの数でAstraの20倍の経済性を誇る一方、精度においてはLunaの4分の1が誤りであるのに対し、Astraは96%の精度を持っています。特に、Lunaは認証や権限に関するコードレビューには適していないとされています。
両モデルの性能差は、コードベースやバグの種類によっても異なることが明らかになりました。特にKeycloakのプルリクエストにおいては、Lunaが見つけたバグの半分以上が検証に失敗しました。このように、コストと精度のバランスを考慮することが、今後のAIによるコードレビューの導入において重要になるでしょう。
公開日: Mon, 14 Sep 2026 19:56:20 +0000
この記事はAIアシスト編集により作成されています。
📰 元記事: 元記事を読む