2026 年 9 月 4 日
フォローアップ クロード寓話 5 と寓話 5.1 の比較。 OpenAI の GPT‑6 Astra に、その下で同じ YAM 武器の制御を与えました。
ロボットをチェックしてみよう 代理店ポリシー、同じ 2 つの立場:
「赤いブロックをテーブルから外して、カップの中に置きます。」
「中央のボタンから丸い青いパズルのピースを取り出し、ボード上の対応する円形の溝に置きます。」
カップの機能として、アストラはその中にブロックを置きました 20 点中 19 点 Fable 5.1 に対するテスト 20 点中 8 点 Fable 5 は 20 の 1 で、テストあたり 2.5 分であるのに対し、Fable 5.1 の 6.8 分は、1 回の実行あたり 0.94 ドルから 2.12 ドルと推定されます。
パズルのタスクは別の話です。Astra は 20 回に 2 回挿入を完了しましたが、Fable 5.1 は 20 回に 2 回でした。これは深く、Fable と同じ最終ステップで実行され、1 回の実行あたり $1.36 から $2.18 です。
ボウル内のブロック: 各モデルの最高のパフォーマンス (最も高いフェーズ、次に最も短いフェーズ) を、それぞれの時間内で同じ速度でプレイします。タイマーは、思考の一時停止によって実際の経過時間を削除します。
Astra はカップの割り当てをより頻繁に実行し、実行あたりのコストは約半分になります
大きなドットは従来のツールです。個別のテストの弱点 (完了した場合は 100、完了していない場合は 0) を独自の値で指定します。
評価する
各試行は人間の採点者によって到達した最高点で採点されたため、失敗した実行でも到達距離が記録されます。ルーブリックは寓話レポートから変更されていません。
| 0 | ターゲットを絞った関係ではない |
| 1 | 接触した物体 |
| 2 | 彼はその物体をテーブルから取り出した |
| 3 | デポジットポイントの上に設置しました |
| 4 | 最終的な位置に配置しました |
アストラはほぼ毎回ブロックを配置します。ファブルがやってるパズルについて
各段階に到達したモデルごとのテストの割合。行ごとの n は、そのセル内の試行回数です。
結果
みんなで走る
各試行は合計 120 回カウントされました。
技術仕様
| 化身 | 両手で I2RT YAM、並列ノードを片手に 6-DoF |
| コントロール | 絶対的な最終ポーズ (move_to): x、y、z、ヨー、ピッチ、ロール、グリッパー、1 つのアーム。ロボットの IK は脚を関節角度に変換します。 |
| 観察 | 3 つのカメラ モード (上、左手、右手) と固有受容モード、各回転 |
| 政治 | agent ポリシー、平均思考労力、20-LLM コール バジェット、25% 速度制限、デフォルト セキュリティ ゲートウェイ |
| モデル | gpt-6-astra、 claude-fable-5 そして claude-fable-5-1 |
| アーチャ | ロボットをチェックしてみよう 0.58.0 |
| 試練 | モデルごと、タスクごとに 20 個。すべてのモデルの場合はリグ-4 でパズル、フェイブル モデルの場合はリグ-3 でボウル、アストラの場合はリグ-1 |
| トークン数 | 計算されたトークンではなく、ワイヤーレベルのリクエストおよびレスポンストークン。定価でのコスト、3 つのモデルすべてで 100 万 I/O トークンあたり 10 ドル/50 ドル |
制限
- アストラ裁判はファブル裁判の2日後に開催され、ファブル裁判とは混合されなかった。パズルの比較は同じデバイス上で行われます。ボウルの比較は同じではありません。Fable ボウルのテストはリグ 3 で実行されましたが、リグ 3 は利用できませんでした。
- スコアは既知のモデルを使用してオペレーターがスコア付けしたものであるため、スコアには無意識の偏見が含まれる可能性があります。
- 費用は定価です。即時キャッシュなしで送信される人為的なリクエスト。 OpenAI は Astra の入力の約 5 分の 1 を自動的にキャッシュしましたが、ここでは割り引いていないため、Astra の価値はどちらかといえば誇張されています。
- オブジェクトは試行間で手動でリセットされ、すべてのモデルは平均的な推論労力のみで実行されました。