合計パラメータ 2.8T、アクティブ トークン (VM) あたり 104B – 上部に Cognition ポスト トレーニングを備えた Kim K3 ベースと、初めて Cognition RL が数兆パラメーター モードに入りました。このベースはすでにエージェンシーコーディング用に RL が多用されていました。認知的変化により、ほとんどの指標で 5 ~ 6 ポイントが追加されました。
- サービスデバイス: 量子化研究を含む NVFP4 および FP8 コアの MOE の概要。 FP8 は、MLA レイヤーで K、Q、V、およびスコアの計算を処理します。 SpecForge で再トレーニングされたドラフト モデルでは、受信長が 15% 向上し、GPU の TPM プリロード レイテンシとリクエストあたりのトークン/秒が 10 ~ 20% 増加します (TTFT が影響を受けます)。
- 努力のレベル: 実行ごとの平均ステップ数は、SWE-1.7 の 127 に対して、53 (平均)、80 (高)、98 (最大) でした。平均では、FrontierCode のスコアが SWE-1.7 よりも高く、回転が 58% 少なく、平均値が 81% 低く、最初の実際の編集はステップ 18 の平均 (SWE-1.7: 48) で行われます。
指標 (認知的自己管理): FrontierCode 1.1 Main 50.0、DeepSWE 1.1 73.0、ターミナルベンチ 2.1 92.8、ターミナルベンチ 4.0 27.3。見出し: FrontierCode の 50.0 は、Claude Fable 5.1 (50.9) に 1 ポイント差、GPT-6 Astra (53.3) に 3.3 ポイント差であり、請求コストは Fable 5.1 より 64% 低く、Astra の 4 分の 1 です。 Terminal-Bench 2.1 は、公開されている表の中で最も高い数値です。ソフトポイントは Terminal-Bench 4.0 で、SWE-2 Fable 5.1 (55.8) と GPT-6 Astra (57.9) の 27.3 トラックが広いマージンを持って配置されています。これは国境までの距離がまだ残っている長期的な政府機関の仕事です。
プロパティの重み、局所的な失敗。 Cognition は SWE-2 重みをリリースしていないため、ダウンロードするものはなく、楽しみにしているラダーもありません。現在、Devin Desktop および CLI で利用でき、Devin Web および Fusion に展開できます。 Cognition は SWE-2 のティックごとの API を公開していないため、タスクごとのコストの比較 (FrontierCode パーで Fable 5.1 より 64% 安い) は価格レベルであり、100 万ドルあたりのベンチマークではありません。ここでの各番号は Cognition 自身の番号であり、独立して複製されるのを待っています。