ロボット Robocurv の手にある GPT-6 アストラ














2026 年 9 月 4 日

フォローアップ クロード寓話 5 と寓話 5.1 の比較。 OpenAI の GPT‑6 Astra に、その下で同じ YAM 武器の制御を与えました。
ロボットをチェックしてみよう 代理店ポリシー、同じ 2 つの立場:

「赤いブロックをテーブルから外して、カップの中に置きます。」

「中央のボタンから丸い青いパズルのピースを取り出し、ボード上の対応する円形の溝に置きます。」

カップの機能として、アストラはその中にブロックを置きました 20 点中 19 点 Fable 5.1 に対するテスト 20 点中 8 点 Fable 5 は 20 の 1 で、テストあたり 2.5 分であるのに対し、Fable 5.1 の 6.8 分は、1 回の実行あたり 0.94 ドルから 2.12 ドルと推定されます。

パズルのタスクは別の話です。Astra は 20 回に 2 回挿入を完了しましたが、Fable 5.1 は 20 回に 2 回でした。これは深く、Fable と同じ最終ステップで実行され、1 回の実行あたり $1.36 から $2.18 です。

ボウル内のブロック: 各モデルの最高のパフォーマンス (最も高いフェーズ、次に最も短いフェーズ) を、それぞれの時間内で同じ速度でプレイします。タイマーは、思考の一時停止によって実際の経過時間を削除します。


Astra はカップの割り当てをより頻繁に実行し、実行あたりのコストは約半分になります

2026-09-04T18:50:02.475437 画像/SVG+XML Matplotlib v3.11.1、https://matplotlib.org/

1ドル 2ドル 3ドル 0 20 40 60 80 100 パフォーマンス率 (%) 凡例 5 凡例 5.1 GPT-6 アストラ 2.4 倍の高い完了率 2.3倍安い ボウルに入れます 1ドル 2ドル 3ドル 凡例 5 凡例 5.1 GPT-6 アストラ 同じフィニッシュスピード 1.6倍安い パズルのピースの詳細 実行あたりの推定コスト (USD、定価)

大きなドットは従来のツールです。個別のテストの弱点 (完了した場合は 100、完了していない場合は 0) を独自の値で指定します。


評価する

各試行は人間の採点者によって到達した最高点で採点されたため、失敗した実行でも到達距離が記録されます。ルーブリックは寓話レポートから変更されていません。

0 ターゲットを絞った関係ではない
1 接触した物体
2 彼はその物体をテーブルから取り出した
3 デポジットポイントの上に設置しました
4 最終的な位置に配置しました

アストラはほぼ毎回ブロックを配置します。ファブルがやってるパズルについて

2026-09-04T18:50:02.444943 画像/SVG+XML Matplotlib v3.11.1、https://matplotlib.org/

凡例 5 (n=20) 凡例 5.1 (n=20) GPT-6 アストラ (n=20) 2 13 3 2 6 2 2 8 19 ボウルに入れます 0 20 40 60 80 100 試行の割合 (%) 凡例 5 (n=20) 凡例 5.1 (n=20) GPT-6 アストラ (n=20) 2 11 2 5 4 4 9 2 3 6 8 2 パズルのピースの詳細 0は近くない 1 連絡先 2 リフトアップ 3 が位置する 4が設定されています

各段階に到達したモデルごとのテストの割合。行ごとの n は、そのセル内の試行回数です。


結果


みんなで走る

各試行は合計 120 回カウントされました。


技術仕様

化身 両手で I2RT YAM、並列ノードを片手に 6-DoF
コントロール 絶対的な最終ポーズ (move_to): x、y、z、ヨー、ピッチ、ロール、グリッパー、1 つのアーム。ロボットの IK は脚を関節角度に変換します。
観察 3 つのカメラ モード (上、左手、右手) と固有受容モード、各回転
政治 agent ポリシー、平均思考労力、20-LLM コール バジェット、25% 速度制限、デフォルト セキュリティ ゲートウェイ
モデル gpt-6-astraclaude-fable-5 そして claude-fable-5-1
アーチャ ロボットをチェックしてみよう 0.58.0
試練 モデルごと、タスクごとに 20 個。すべてのモデルの場合はリグ-4 でパズル、フェイブル モデルの場合はリグ-3 でボウル、アストラの場合はリグ-1
トークン数 計算されたトークンではなく、ワイヤーレベルのリクエストおよびレスポンストークン。定価でのコスト、3 つのモデルすべてで 100 万 I/O トークンあたり 10 ドル/50 ドル

制限

  • アストラ裁判はファブル裁判の2日後に開催され、ファブル裁判とは混合されなかった。パズルの比較は同じデバイス上で行われます。ボウルの比較は同じではありません。Fable ボウルのテストはリグ 3 で実行されましたが、リグ 3 は利用できませんでした。
  • スコアは既知のモデルを使用してオペレーターがスコア付けしたものであるため、スコアには無意識の偏見が含まれる可能性があります。
  • 費用は定価です。即時キャッシュなしで送信される人為的なリクエスト。 OpenAI は Astra の入力の約 5 分の 1 を自動的にキャッシュしましたが、ここでは割り引いていないため、Astra の価値はどちらかといえば誇張されています。
  • オブジェクトは試行間で手動でリセットされ、すべてのモデルは平均的な推論労力のみで実行されました。




Source link