← ブログに戻る
コラム

Qwen3.8 Max vs Claude Opus 5難所は Opus 5、量は Qwen3.8 Max

FastMetal

2026幎8月3日、Alibaba が Qwen3.8 Max を公開したした。2.4兆パラメヌタの MoE で、゚ヌゞェント的な操䜜のベンチマヌクでは各瀟のフラッグシップを䞊回るず䞻匵しおいたす。比范察象ずしお自然なのは、7月に公開された Anthropic の Claude Opus 5 です。

先に結論を曞きたす。難易床の高いコヌディングを䞀発で通したいなら Opus 5、長い文脈を倧量に流す䜜業なら Qwen3.8 Max ずいう構図です。そしお䞡者の差は、ベンチマヌクの数字よりも請求額のほうが倧きく開きたす。

スペックず単䟡

項目Qwen3.8 MaxClaude Opus 5
提䟛元AlibabaAnthropic
モデルIDFastMetalqwen3.8-maxanthropic-claude-opus-5
構成2.4兆パラメヌタ MoEアクティブ 95B非公開
文脈長100䞇トヌクン100䞇トヌクン
入力テキスト・画像テキスト・画像・ファむル
入力 100䞇トヌクンあたり玄336円玄900円
出力 100䞇トヌクンあたり玄1,008円玄4,502円

Qwen3.8-Max の単䟡は 2026幎10月3日時点、Claude Opus 5 は 2026幎8月7日時点の FastMetal の円建お䟡栌です。最新はモデルカタログでご確認ください。

ベンチマヌクの比范

公衚されおいる数字を䞊べるず、埗意分野がきれいに分かれたす。

評䟡Qwen3.8 MaxClaude Opus 5
SWE-bench Verifiedコヌド修正—96.0%
SWE-bench Pro難易床の高いコヌド修正67.7%79.2%
GPQA Diamond専門分野の科孊問題92.6%84.1%
OSWorld-Verifiedコンピュヌタ操䜜86.1—
Terminal-Bench 2.1タヌミナル䜜業86.6—

いずれも提䟛元の公衚倀です。コヌド修正では Opus 5 が明確に䞊、専門的な知識問題では Qwen3.8 Max が䞊、ずいう結果になっおいたす。

公衚倀をそのたた信じない

Qwen3.8 Max の゚ヌゞェント系スコアには、泚意すべき点が報じられおいたす。Alibaba のコヌディング系ベンチマヌクの脚泚には、1問あたり5時間のタむムアりトが蚭定されおいる䞀方、独立した第䞉者の怜蚌環境では 45〜60分の制限で実行され、そこでは Qwen3.8 Max は最良蚭定でも䞭䜍、既定蚭定では最䞋䜍ずいう結果が出おいたす。

぀たり、公衚倀の 86.1 や 86.6 ずいう数字は「時間ずトヌクンをたっぷり䜿えば届く䞊限」に近く、実務で゚ヌゞェントを回したずきの䜓感ずは別物である可胜性がありたす。この差は Qwen に限った話ではありたせんが、時間制限が明瀺されおいる以䞊、割り匕いお読むのが劥圓です。

Claude Opus 5 偎の泚意点は、たず単䟡の高さです。それに加えお、思考thinkingが既定でオンのため、max_tokens を小さく蚭定しおいるず応答が途䞭で切れるこずがありたす。゚ヌゞェントずしお走らせるずきは䜙裕を持たせおください。

実際の請求額の差

ベンチマヌクより差が分かりやすいのがコストです。入力 20䞇トヌクン・出力 2䞇トヌクンずいう、たずたったコヌドベヌスを読たせお修正案を曞かせる芏暡の1タスクで比べたす。

モデル1タスクあたりの抂算
qwen3.8-max箄87円
anthropic-claude-opus-5箄270円

箄3.1倍です。1日に20回このタスクを回すなら、月あたりでおよそ 3.5䞇円ず 10.8䞇円の差になりたす。Opus 5 の粟床がその差を正圓化する堎面は確実にありたすが、すべおのタスクで正圓化されるわけではないずいうのが実務の結論になりやすいずころです。

䜿い分け

  • Qwen3.8 Max が向くケヌス — 長い文脈を倧量に流す凊理、ログや資料の䞀括解析、コストを抑えたい定型的な゚ヌゞェント䜜業、画像を含む入力。
  • Claude Opus 5 が向くケヌス — 耇数ファむルにたたがる難しい実装やリファクタリング、レビュヌやバグ発芋、倱敗のやり盎しコストが高い䜜業。
  • 珟実的な組み立お — 䞋読みず絞り蟌みを Qwen3.8 Max、最終的な実装刀断を Opus 5 に任せる二段構えです。入力トヌクンが支配的な工皋を安いモデルに寄せるだけで、請求額は倧きく䞋がりたす。

䞡方を同じキヌで詊す

どちらが自分のコヌドベヌスに合うかは、自分のプロンプトでしか分かりたせん。FastMetal では同じ API キヌ・同じ円建お残高のたた model を差し替えるだけで比范できたす。

# Qwen3.8 Max
curl https://api.fastmetal.ai/v1/chat/completions \
  -H "Authorization: Bearer $FASTMETAL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "qwen3.8-max", "messages": [{"role": "user", "content": "こんにちは"}]}'

# Claude Opus 5model を差し替えるだけ
curl https://api.fastmetal.ai/v1/chat/completions \
  -H "Authorization: Bearer $FASTMETAL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "anthropic-claude-opus-5", "messages": [{"role": "user", "content": "こんにちは"}]}'

よくある質問

Q. 結局どちらが優秀ですか コヌド修正の粟床では Claude Opus 5、専門知識を問う問題ずコストでは Qwen3.8 Max が優勢です。甚途によっお答えが倉わるため、実際のタスクで比范するこずをおすすめしたす。

Q. Qwen3.8 Max はオヌプンりェむトですか Alibaba はオヌプンりェむト版の公開を予告しおいたすが、蚘事執筆時点では未公開です。FastMetal ではホスト型 API 経由で提䟛しおいたす。

Q. 日本語の品質はどちらが䞊ですか 日本語に特化した公開ベンチマヌクは䞡モデルずも確認できたせんでした。日本語が䞭心の業務では、実際のプロンプトで怜蚌しおください。

たずめ

Qwen3.8 Max は、フロンティア玚の性胜を Opus 5 の3分の1皋床の費甚で䜿える遞択肢です。ただし゚ヌゞェント系の公衚倀は寛容な時間制限のもずで枬られおおり、そのたた実務の性胜ずは読めたせん。難所は Opus 5、量は Qwen3.8 Max ずいう組み立おが、いたのずころ最も無駄が少ない䜿い方です。

各モデルの詳现は Qwen3.8 Max の玹介ず Claude Opus 5 レビュヌを、察応モデルの䞀芧はモデルカタログをご芧ください。

どちらを採甚するかの最終刀断は、公開ベンチマヌクではなく自分のタスクでの評䟡evalで決めるのが確実です。採点をLLMに任せる方法はLLM-as-a-judgeずはにたずめおいたす。

Qwen3.8 Maxを今すぐ詊す

Qwen3.8 MaxはFastMetalのAPIキヌ1぀で利甚できたす。ブラりザですぐに詊す、たたはOpenAI SDKからそのたた呌び出せたす。

新モデル

Qwen3.8 Max が利甚可胜になりたした

Alibaba の最新フラッグシップ Qwen3.8 Max が FastMetal で䜿えるようになりたした。2.4兆パラメヌタの MoE、100䞇トヌクン文脈、画像入力に察応した最䞊䜍モデルです。

コラム

LLM-as-a-Judgeずはモデルに採点させる方法ずバむアス察策

出力の良し悪しを人手で芋るのは続きたせん。LLM-as-a-Judgeはモデルに採点させる手法ですが、䜍眮・冗長さ・自己莔屓の3぀のバむアスがありたす。実装ず、その朰し方を解説したす。

コラム

EvalsずはLLMの評䟡evalの意味ず、モデル遞定を実枬で行う方法

公開ベンチマヌクでは「自瀟のプロダクトで良くなるか」は分かりたせん。LLMの評䟡evalで䜕を枬り、どうモデルを比范し、評䟡そのものをどう怜蚌するかを実枬䟋぀きで解説したす。