思考(推論)の制御

推論モデルは回答の前に「思考」トークンを生成し、それは出力トークンとして課金されます。reasoning パラメータで思考の強度を指定するか、思考をオフにできます。指定しない場合の動作はモデルごとに異なり、Kimi K3 のように既定で最大強度で思考するモデルもあります。

思考トークンの課金

思考トークンは completion_tokens に含まれ、出力トークンの単価で課金されます。内訳はレスポンスの usage.completion_tokens_details.reasoning_tokens で確認できます。回答が1語でも、思考が数百トークン走れば請求はその分になります。

レスポンスの usage 例
"usage": {
  "prompt_tokens": 113,
  "completion_tokens": 43,
  "completion_tokens_details": {
    "reasoning_tokens": 26
  }
}

思考の本文は message.reasoning_content(ストリーミングでは delta.reasoning_content)に入り、回答の content とは分かれています。表示しない場合でも課金は発生します。

reasoning パラメータ

/v1/chat/completions のリクエストに reasoning オブジェクトを付けます。effort(強度)と max_tokens(思考トークンの上限)はどちらか一方を指定してください。

強度を指定する

effort には none / minimal / low / medium / high / xhigh / max を指定できます。モデルが受け付ける値は下の表を参照してください。受け付けない値を送ると 400 になります。

curl https://api.fastmetal.ai/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "..."}],
    "reasoning": {"effort": "low"}
  }'

思考をオフにする

enabled: false で思考を止めます。一問一答や分類など軽い用途では、応答が速くなりコストも下がります。常に思考するモデル(表の「オフ」が「不可」のもの)では効きません。

{
  "model": "kimi-k3",
  "messages": [{"role": "user", "content": "..."}],
  "reasoning": {"enabled": false}
}

思考トークンに上限を付ける

max_tokens で思考に使うトークン数の上限を指定します(Anthropic 形式)。effort と同時には指定できません。

{
  "model": "kimi-k3",
  "messages": [{"role": "user", "content": "..."}],
  "reasoning": {"max_tokens": 2000}
}

reasoning_effort について

OpenAI 形式の reasoning_effort(トップレベルの文字列)は、モデルによっては無視されます。2026-09-03 に kimi-k3 へ reasoning_effort: "none" を送ったところ、思考トークンが通常どおり発生しました。GPT-5 系では有効ですが、FastMetal では OpenRouter 経由のモデル全てで効く reasoning オブジェクトの利用を推奨します。Bedrock 経由の Claude(anthropic-claude-*)と国内ホストのルート(japan-*、llm-jp、gpt-oss-120b)は現時点では対象外で、下の表にも載りません。

モデルごとの既定値

reasoning を指定しない場合の動作です。提供中のモデルのうち、思考の制御に対応しているものを表示しています。

モデル既定指定できる強度オフ
anthropic-claude-fable-5思考オン(high)
max
xhigh
high
medium
low
不可
anthropic-claude-fable-5-1思考オン(high)
max
xhigh
high
medium
low
不可
anthropic-claude-opus-4-8思考オフ
max
xhigh
high
medium
low
anthropic-claude-opus-5思考オン(high)
max
xhigh
high
medium
low
anthropic-claude-sonnet-5思考オン(high)
max
xhigh
high
medium
low
deepseek-v4-flash思考オン(high)
xhigh
high
deepseek-v4-flash-0731思考オン(high)
max
high
low
deepseek-v4-pro思考オン(high)
xhigh
high
deepseek-v4.1-flash思考オン(high)
max
high
low
gemini-3.5-flash思考オン(medium)
high
medium
low
minimal
不可
gemini-3.7-flash思考オン(medium)
high
medium
low
不可
gemini-3.8-flash思考オン(medium)
high
medium
low
不可
glm-4.7思考オン-
glm-4.7-flash思考オン-
glm-5思考オン-
glm-5.1思考オン-
glm-5.2思考オン(high)
xhigh
high
glm-5.3思考オン(max)
max
high
low
不可
glm-5.3-flash思考オン(max)
max
high
low
不可
gpt-5.6-luna思考オン(medium)
max
xhigh
high
medium
low
none
gpt-5.6-sol思考オン(medium)
max
xhigh
high
medium
low
none
gpt-5.6-terra思考オン(medium)
max
xhigh
high
medium
low
none
gpt-6-astra思考オン(medium)
max
xhigh
high
medium
low
不可
gpt-6-astra-pro思考オン(medium)
max
xhigh
high
medium
low
不可
grok-4.5思考オン(high)
high
medium
low
不可
grok-4.6思考オン(high)
xhigh
high
medium
low
不可
inkling思考オン(high)
max
high
medium
low
minimal
none
kimi-k2.6思考オン-
kimi-k3思考オン(max)
max
high
low
mercury-2.5思考オン(medium)
high
medium
low
none
minimax-m2.7思考オン-不可
muse-glimmer-30b思考オン(medium)
xhigh
high
medium
low
不可
muse-spark-1.2思考オン(medium)
xhigh
high
medium
low
minimal
不可
muse-spark-1.3思考オン(medium)
max
xhigh
high
medium
low
minimal
不可
nex-n2.5-mini-free思考オン(high)
high
medium
none
qwen3.6-27b思考オン-
qwen3.7-max思考オン-
qwen3.8-2.4t-a95b思考オン(xhigh)
xhigh
medium
low
不可
qwen3.8-27b思考オン(xhigh)
xhigh
medium
low

表にないモデルは、思考の制御に対応していないか、カタログにまだ情報がないものです。各モデルの詳細ページの「推論設定」も同じ情報を表示します。

チャットでの設定

チャット画面では、思考を制御できるモデルを選ぶとモデル選択の横に「思考」セレクタが表示されます。既定はそのモデルが受け付ける最も低い強度で、選んだ値はブラウザに記憶されます。 チャットを開く