ブログに戻る
レビュー

Qwen3.7-Max レビュー:35時間走り続けるエージェント特化のフラッグシップ

FastMetal

結論から言うと、Qwen3.7-Max(qwen3.7-max)は「人が張り付かずに、長時間かかる作業をエージェントに任せたい」場面のためのモデルです。汎用チャットの最上位を狙うというより、エージェントとして走り続ける能力に振り切った設計になっています。

概要:Qwen 系のクローズド・フラッグシップ

Qwen3.7-Max は Alibaba が 2026年5月に発表した Qwen3.7 シリーズのフラッグシップです。ここは誤解されやすい点ですが、このモデルはオープンウェイトではありません。Qwen は多くのオープンモデルを公開してきましたが、Max クラスはクローズドの提供です。

  • 文脈長:約100万トークン(最大出力 64K トークン)
  • 入出力:テキストのみ
  • 位置づけ:エージェント用途に最適化されたフラッグシップ

100万トークンはおおよそ2,000ページ相当で、多くの業務コードベースを検索の仕組みなしにそのまま載せられる規模です。

ベンチマーク:エージェント系で Opus 4.7 を上回る

報じられている数値では、エージェント的なコーディング評価で Claude Opus 4.7 を上回っています。

ベンチマークQwen3.7-MaxClaude Opus 4.7
Terminal-Bench 2.069.765.4
SWE-Bench Pro60.657.3
MCP-Atlas76.475.8

このほか SWE-bench Verified で 80.4SWE-Multilingual で 78.3 と報告されています。Artificial Analysis の Intelligence Index v4.0 では 56.6 で世界トップ5圏内に入り、中国系モデルとして最上位の位置づけと報じられています。

「35時間走る」とはどういうことか

Alibaba の技術記事では、Qwen3.7-Max が 35時間にわたる CUDA カーネル最適化タスクを自律実行した例が紹介されています。この間に 1,158回のツール呼び出し432回のカーネル評価を行い、コンパイルエラーを自力で診断しながら改善を重ね、最終的に幾何平均で 10倍の高速化に到達したとされています。

ここで効いているのは瞬間的な賢さより、長時間にわたって状態を見失わない持久力です。一往復の会話品質を比べるベンチマークでは、この性質は測りにくい部分です。

コスト感

長時間エージェントは、単価よりも総トークン量が効いてきます。35時間走らせれば、それに見合った消費が発生します。単価だけで判断せず、「1タスクあたりいくらか」で見積もってください。

FastMetal はプリペイド式で、残高の上限を超えて課金されることがありません。暴走したエージェントに青天井で課金される事故を構造的に防げるため、この種のモデルを試すには相性が良い仕組みです。円建ての単価は料金ページでご確認ください。

日本語での使い勝手

多言語対応で、日本語の一般的なタスクでは実用的です。SWE-Multilingual の 78.3 は多言語コーディングの指標であり、日本語の文章品質を直接示すものではない点には注意してください。日本語特化のベンチマークは確認できませんでした。日本語での指示追従や敬語の扱いが重要な用途では、実プロンプトでの検証をおすすめします。

向いている用途/向かない用途

向いている:

  • 長時間・多段階の自律的なエージェント実行
  • ターミナル操作やツール呼び出しを大量に伴う自動化
  • 100万トークン級のコードベースをまるごと読ませる作業
  • 人が張り付かずに回したいバッチ的な開発タスク

向かない:

  • 画像・音声を扱うマルチモーダル用途(テキスト専用です)
  • オープンウェイトである必要がある要件(クローズドモデルです)
  • 短い応答を大量に返す、レイテンシ最優先の用途

よくある質問

Q. Qwen3.7-Max はオープンモデルですか? いいえ。Qwen シリーズには多くのオープンウェイトモデルがありますが、Max クラスはクローズドの提供です。

Q. 何が他のモデルと違いますか? 長時間にわたる自律実行に最適化されている点です。エージェント系のベンチマーク(Terminal-Bench 2.0、SWE-Bench Pro、MCP-Atlas)で Claude Opus 4.7 を上回ったと報じられています。

Q. 日本語は問題なく使えますか? 一般用途では実用的ですが、日本語特化のベンチマークは確認できませんでした。重要な用途では実プロンプトでの検証をおすすめします。

FastMetal で試す

curl https://api.fastmetal.ai/v1/chat/completions \
  -H "Authorization: Bearer $FASTMETAL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.7-max",
    "messages": [{"role": "user", "content": "こんにちは"}]
  }'

同じ API キー・同じ円建て残高のまま、Claude などのモデルと model を差し替えて比較できます。対応モデルはモデルカタログでご確認ください。