思考(推論)の制御
推論モデルは回答の前に「思考」トークンを生成し、それは出力トークンとして課金されます。reasoning パラメータで思考の強度を指定するか、思考をオフにできます。指定しない場合の動作はモデルごとに異なり、Kimi K3 のように既定で最大強度で思考するモデルもあります。
思考トークンの課金
思考トークンは completion_tokens に含まれ、出力トークンの単価で課金されます。内訳はレスポンスの usage.completion_tokens_details.reasoning_tokens で確認できます。回答が1語でも、思考が数百トークン走れば請求はその分になります。
"usage": {
"prompt_tokens": 113,
"completion_tokens": 43,
"completion_tokens_details": {
"reasoning_tokens": 26
}
}思考の本文は message.reasoning_content(ストリーミングでは delta.reasoning_content)に入り、回答の content とは分かれています。表示しない場合でも課金は発生します。
reasoning パラメータ
/v1/chat/completions のリクエストに reasoning オブジェクトを付けます。effort(強度)と max_tokens(思考トークンの上限)はどちらか一方を指定してください。
強度を指定する
effort には none / minimal / low / medium / high / xhigh / max を指定できます。モデルが受け付ける値は下の表を参照してください。受け付けない値を送ると 400 になります。
curl https://api.fastmetal.ai/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "..."}],
"reasoning": {"effort": "low"}
}'思考をオフにする
enabled: false で思考を止めます。一問一答や分類など軽い用途では、応答が速くなりコストも下がります。常に思考するモデル(表の「オフ」が「不可」のもの)では効きません。
{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "..."}],
"reasoning": {"enabled": false}
}思考トークンに上限を付ける
max_tokens で思考に使うトークン数の上限を指定します(Anthropic 形式)。effort と同時には指定できません。
{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "..."}],
"reasoning": {"max_tokens": 2000}
}reasoning_effort について
OpenAI 形式の reasoning_effort(トップレベルの文字列)は、モデルによっては無視されます。2026-09-03 に kimi-k3 へ reasoning_effort: "none" を送ったところ、思考トークンが通常どおり発生しました。GPT-5 系では有効ですが、FastMetal では OpenRouter 経由のモデル全てで効く reasoning オブジェクトの利用を推奨します。Bedrock 経由の Claude(anthropic-claude-*)と国内ホストのルート(japan-*、llm-jp、gpt-oss-120b)は現時点では対象外で、下の表にも載りません。
モデルごとの既定値
reasoning を指定しない場合の動作です。提供中のモデルのうち、思考の制御に対応しているものを表示しています。
| モデル | 既定 | 指定できる強度 | オフ |
|---|---|---|---|
| anthropic-claude-fable-5 | 思考オン(high) | max xhigh high medium low | 不可 |
| anthropic-claude-fable-5-1 | 思考オン(high) | max xhigh high medium low | 不可 |
| anthropic-claude-opus-4-8 | 思考オフ | max xhigh high medium low | 可 |
| anthropic-claude-opus-5 | 思考オン(high) | max xhigh high medium low | 可 |
| anthropic-claude-sonnet-5 | 思考オン(high) | max xhigh high medium low | 可 |
| deepseek-v4-flash | 思考オン(high) | xhigh high | 可 |
| deepseek-v4-flash-0731 | 思考オン(high) | max high low | 可 |
| deepseek-v4-pro | 思考オン(high) | xhigh high | 可 |
| deepseek-v4.1-flash | 思考オン(high) | max high low | 可 |
| gemini-3.5-flash | 思考オン(medium) | high medium low minimal | 不可 |
| gemini-3.7-flash | 思考オン(medium) | high medium low | 不可 |
| gemini-3.8-flash | 思考オン(medium) | high medium low | 不可 |
| glm-4.7 | 思考オン | - | 可 |
| glm-4.7-flash | 思考オン | - | 可 |
| glm-5 | 思考オン | - | 可 |
| glm-5.1 | 思考オン | - | 可 |
| glm-5.2 | 思考オン(high) | xhigh high | 可 |
| glm-5.3 | 思考オン(max) | max high low | 不可 |
| glm-5.3-flash | 思考オン(max) | max high low | 不可 |
| gpt-5.6-luna | 思考オン(medium) | max xhigh high medium low none | 可 |
| gpt-5.6-sol | 思考オン(medium) | max xhigh high medium low none | 可 |
| gpt-5.6-terra | 思考オン(medium) | max xhigh high medium low none | 可 |
| gpt-6-astra | 思考オン(medium) | max xhigh high medium low | 不可 |
| gpt-6-astra-pro | 思考オン(medium) | max xhigh high medium low | 不可 |
| grok-4.5 | 思考オン(high) | high medium low | 不可 |
| grok-4.6 | 思考オン(high) | xhigh high medium low | 不可 |
| inkling | 思考オン(high) | max high medium low minimal none | 可 |
| kimi-k2.6 | 思考オン | - | 可 |
| kimi-k3 | 思考オン(max) | max high low | 可 |
| mercury-2.5 | 思考オン(medium) | high medium low none | 可 |
| minimax-m2.7 | 思考オン | - | 不可 |
| muse-glimmer-30b | 思考オン(medium) | xhigh high medium low | 不可 |
| muse-spark-1.2 | 思考オン(medium) | xhigh high medium low minimal | 不可 |
| muse-spark-1.3 | 思考オン(medium) | max xhigh high medium low minimal | 不可 |
| nex-n2.5-mini-free | 思考オン(high) | high medium none | 可 |
| qwen3.6-27b | 思考オン | - | 可 |
| qwen3.7-max | 思考オン | - | 可 |
| qwen3.8-2.4t-a95b | 思考オン(xhigh) | xhigh medium low | 不可 |
| qwen3.8-27b | 思考オン(xhigh) | xhigh medium low | 可 |
表にないモデルは、思考の制御に対応していないか、カタログにまだ情報がないものです。各モデルの詳細ページの「推論設定」も同じ情報を表示します。
チャットでの設定
チャット画面では、思考を制御できるモデルを選ぶとモデル選択の横に「思考」セレクタが表示されます。既定はそのモデルが受け付ける最も低い強度で、選んだ値はブラウザに記憶されます。 チャットを開く