Refresh( @refresh_dev )が、Blenderを使ったAIエージェントの実制作能力を評価するベンチマーク「BlenderBench」を公開。20種類のBlenderタスクを使いGPT-6 AstraとClaude Opus 5.5を比較しています。
BlenderBench

Refreshが、AIエージェントによるBlender操作能力を評価するベンチマーク「BlenderBench」を公開しています。
BlenderBenchでは、単純なモデリングだけでなく、アニメーション、リギング、マテリアル、ライティング、クロスシミュレーション、UV、ヘアなど、Blenderを使った複数の制作タスクをAIに実行させ、その結果を比較しています。
今回公開されている結果では、GPT系モデルとClaude系モデルを同じタスク条件で比較しており、カテゴリごとに得意不得意の違いも確認できます。
単に完成画像の見た目だけを見るのではなく、保存されたBlenderファイルや制作結果も含めて評価しているのが特徴です。
各タスクごとのスコアや実際の成果、AIがどのような手順でBlenderを操作したのかといった詳細も公式サイトから確認できます。
AIにBlenderを操作させるワークフローが増えてきた中で、モデルごとの能力を同じ条件で比較できる指標として、今後の展開も気になるベンチマークです。
最近はAIにBlenderを直接操作させる事例もかなり増えてきましたが
こうやって同じタスクで比較できるベンチマークが出てくるのは面白いですね
モデルによって得意な作業がかなり違うのも興味深いところ
細かい比較結果や実際の成果物も見られるので
気になる人は公式サイトをチェックしてみてください!
それにしてもAIもどんどん進化していくので
こういう情報もどんどん更新されていくのかなぁ










コメント