LLM APIとは?使い方・料金の仕組み・選び方を開発者向けに解説

この記事の要点
- LLM APIは、大規模言語モデルをプログラムから呼び出すための窓口です。モデルの名前と会話をJSONで送り、生成された文章をJSONで受け取ります。
- 料金はトークン単位の従量課金が中心です。入力と出力それぞれに、100万トークンあたりの単価が決まっています。
- OpenAI互換の形式が事実上の共通語になっており、接続先とキーを差し替えるだけで別の会社のモデルを呼べます。
- 選ぶときは、モデルと機能、料金の単位、利用の上限、データの扱い、請求の通貨、適格請求書の6点を確かめます。
- 複数社のモデルを使う場合は、AIゲートウェイを通せばAPIキーと請求を1つにまとめられます。
LLM APIとは、ChatGPTやClaude、Geminiを動かしている大規模言語モデル(LLM)を、自分のアプリやシステムから呼び出すためのAPIです。プログラムから質問を送り、返ってきたモデルの回答をアプリの機能として使えます。
この記事では、LLM APIの仕組み、トークン課金、主な提供元、OpenAI互換API、提供元の選び方を開発者の目線で整理します。あわせて、「AI API」「生成AI API」との関係も取り上げます。
LLM APIとは
LLM(Large Language Model、大規模言語モデル)は、膨大な文章から学習し、文章の生成や要約、翻訳、コードの作成などをこなすAIモデルです。このLLMを外部のプログラムから使えるようにした窓口が、LLM APIです。モデルを開発した会社や、モデルを預かって動かす事業者が、インターネット経由で提供しています。
APIキーを発行し、決められた形式でリクエストを送るだけで、最新のモデルを自分のアプリに組み込めます。GPUの用意やモデルの運用は、提供元が引き受けます。
チャット画面とLLM APIの違い
同じモデルでも、チャット画面で使う場合とAPIで使う場合とでは、使い方も支払い方も変わります。
| チャット画面 | LLM API | |
|---|---|---|
| 使う人 | 人が手で入力する | プログラムが自動で呼び出す |
| 主な用途 | 調べもの、文章の下書き | アプリへの組み込み、業務の自動化、エージェント |
| 料金の形 | 月額の定額プランが中心 | 使った量に応じた従量課金が中心 |
| 会話の履歴 | 画面の側で保持される | 呼び出す側が毎回まとめて送る |
| 細かな指定 | 画面で選べる範囲 | モデル、出力の長さ、出力形式などを指定できる |
見落とされやすいのが、会話の履歴です。APIはリクエストごとに独立しているため、前のやり取りを踏まえた回答がほしいときは、それまでの会話をまとめて送り直します。この仕組みは、料金にも関わってきます。
LLM APIでできること
- 問い合わせへの回答や、社内向けのチャットボット
- 議事録、メール、長い資料の要約と翻訳
- 文章の分類やタグ付け、テキストから必要な項目を抜き出してJSONで受け取る処理
- コードの生成やレビュー、Claude CodeやCodexのようなコーディングエージェント
- 社内文書を検索してから答えさせるRAG
さらに、外部の関数やツールをモデルに呼ばせるFunction callingを組み合わせると、モデルが自分でデータを取りに行き、作業を進めるエージェントも作れます。
LLM APIの仕組み:リクエストからレスポンスまで
1回の呼び出しの流れ
LLM APIの呼び出しは、HTTPのリクエストとレスポンスの往復です。流れは次の4段階に分けられます。
- 提供元でアカウントを作り、APIキーを発行します。
- 使うモデルの名前(モデルID)と会話の内容(messages)をJSONにまとめ、APIキーを添えて送ります。
- 提供元のサーバーで、モデルが回答を生成します。
- 生成された文章と、使ったトークン数がJSONで返ってきます。
OpenAI互換の形式で書くと、リクエストは次のようになります。
curl https://api.fastmetal.ai/v1/chat/completions \
-H "Authorization: Bearer $FASTMETAL_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "anthropic-claude-sonnet-5",
"messages": [
{"role": "system", "content": "あなたは簡潔に答えるアシスタントです。"},
{"role": "user", "content": "LLM APIを3行で説明してください。"}
]
}'
messages には役割(role)ごとに発言を並べます。system はモデルに前提として与える指示、user は利用者の発言、assistant はモデルの過去の回答です。レスポンスには、回答の本文と、課金の根拠になるトークン数が入っています。
{
"choices": [
{"message": {"role": "assistant", "content": "LLM APIは、..."}, "finish_reason": "stop"}
],
"usage": {"prompt_tokens": 38, "completion_tokens": 95, "total_tokens": 133}
}
usage の prompt_tokens が入力、completion_tokens が出力のトークン数です。それぞれに単価を掛けて合計したものが、1回の呼び出しの費用です。
トークンと料金の仕組み
トークンとは
トークンは、LLMが文章を処理するときの最小の単位です。英語ではおおむね単語やその一部が1トークンにあたり、日本語は同じ内容を英語で書いた場合より多くのトークンを使う傾向があります。数え方はモデルごとに異なり、同じ文章でもモデルを替えるとトークン数が変わります。詳しくはLLMのトークンとはと、日本語のトークンとコストの関係で解説しています。
100万トークンあたりの従量課金
LLM APIの料金は、入力トークンと出力トークンに別々の単価を掛ける従量課金が基本です。単価は「100万トークンあたり」で示され、出力の単価は入力より高く設定されるのが一般的です。1回の費用は、次の式で求められます。
費用 = 入力トークン数 ÷ 100万 × 入力の単価 + 出力トークン数 ÷ 100万 × 出力の単価
たとえば、1回あたり入力2,000トークン、出力500トークンの処理を月に1万回行うと、入力は合計2,000万トークン、出力は500万トークンです。入力の単価の20倍と出力の単価の5倍を足したものが、その月の費用の目安になります。
推論(思考)を行うモデルでは、回答の前に内部で考えた分も出力トークンとして数えられ、出力の単価で課金されます。
費用が膨らみやすい3つの場面
- 会話の履歴を送り直すとき:会話が続くほど、毎回の入力が長くなります。1回に送れる量の上限は、モデルごとのコンテキストウィンドウで決まります。
- 出力が長いとき:長文の生成や、思考の長い推論モデルでは、単価の高い出力トークンが増えます。
max_tokensで出力の上限を決めておくと安心です。 - エージェントに任せるとき:コーディングエージェントは1つの作業でモデルを何度も呼び、そのたびに文脈を送り直すため、入力トークンが費用の大半を占めます。プロンプトキャッシュに対応したモデルを選ぶと、費用を抑えやすくなります。
具体的な削減の手順は、LLM APIのコストを下げる方法にまとめています。
主なLLM APIの提供元
代表的なモデルの開発元と主なモデルは、次のとおりです(2026年10月時点)。
| 提供元 | 主なモデル | 単価の確認先 |
|---|---|---|
| Anthropic | Claude Opus 5.5、Sonnet 5.5、Haiku 4.5 | 公式の料金ページ |
| OpenAI | GPT-6.1 Sol、GPT-6 Luna、GPT-5.6 Terra | 公式の料金ページ |
| Gemini 3.1 Pro Preview、Gemini 3.8 Flash | 公式の料金ページ | |
| DeepSeek | DeepSeek V4 Pro、V4.1 Flash | 公式の料金ページ |
| xAI | Grok 4.7 | 公式のモデル一覧 |
| Moonshot AI | Kimi K3 | 公式の料金ページ |
| Z.ai | GLM 5.3 | 公式の料金ページ |
このほか、Qwen、Meta、Mistral AI、日本のSakana AIなどのモデルもAPIで使えます。単価は改定が続くため、最新の金額は各社の公式ページで確かめてください。
使い方は大きく分けて3通りあります。モデルの開発元と直接契約する方法、Amazon BedrockやGoogle CloudのVertex AIのようなクラウドを経由する方法、複数社のモデルをまとめて扱うAIゲートウェイを使う方法です。提供元の種類ごとの特徴はLLM APIプロバイダー比較で整理しています。まず無料で試したい場合は、無料で使えるLLM APIのまとめが参考になります。
OpenAI互換APIが事実上の共通形式
APIの形式は提供元ごとに少しずつ異なりますが、今では多くの提供元やツールが、OpenAIのChat Completions APIと同じ形式のリクエストを受け付けています。これがOpenAI互換APIです。OpenAIのSDKや対応ツールなら、接続先のURL(ベースURL)とAPIキーを差し替えるだけで、別の提供元のモデルを呼び出せます。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_FASTMETAL_API_KEY",
base_url="https://api.fastmetal.ai/v1",
)
resp = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "こんにちは"}],
)
print(resp.choices[0].message.content)
model を anthropic-claude-sonnet-5 や gpt-6.1-sol に変えれば、コードはそのままで別の会社のモデルに切り替わります。仕組みとメリットはOpenAI互換APIとはで、リクエストの書き方の基本はChat Completions APIとはで詳しく解説しています。
互換でも残るモデルごとの違い
形式がそろっても、モデルごとの違いは残ります。
- 対応する機能:ツール呼び出し、画像入力、構造化出力、ストリーミングへの対応は、モデルによって異なります。
- パラメータの扱い:
temperatureの範囲や、思考の量を指定する方法はモデルごとに違います。 - Anthropic形式:Claude CodeはAnthropicのMessages API形式で通信するため、OpenAI互換の窓口だけではつながりません。Anthropic互換の窓口があるかを確かめます。FastMetalは両方の形式に対応しており、設定はClaude Codeのガイドにまとめています。
AI APIとは:LLM APIとの関係
AI APIは、AIの機能を外部から呼び出せるAPIの総称です。文章を扱うLLM APIはその一部で、ほかにも次のような種類があります。
| 種類 | できること | 主な課金の単位 |
|---|---|---|
| LLM API | 回答、要約、翻訳、コード生成 | 100万トークンあたり |
| 埋め込み(エンベディング) | 文章を数値のベクトルに変え、検索や分類に使う | 100万トークンあたり |
| 画像生成 | 指示文から画像を作る | 1枚あたり |
| 動画生成 | 指示文や画像から動画を作る | 1本あたり、または秒数あたり |
| 音声認識・音声合成 | 文字起こし、読み上げ | 時間あたり、または文字数あたり |
以前は用途ごとに専用のAPIを使い分けるのが一般的でした。今はLLM自体が画像を読み取り、決まった形のJSONも返せるため、LLM APIを中心に組み立てる場面が増えています。埋め込みの仕組みはEmbeddingとはで解説しています。
FastMetalでは、テキストの生成に加えて、画像生成(1枚ごとの課金)、動画生成(1本ごとの課金)、画像入力に対応したモデルを、同じAPIキーで呼び出せます。
生成AI APIとは:使い始めるまでの流れ
生成AI APIは、文章や画像、動画を新しく作り出すAIを、APIで呼び出す仕組みを指す言葉です。中心にあるのは文章を作るLLM APIで、画像や動画の生成APIも含めてこう呼ばれます。呼び方は違っても、使い始めるまでの流れは共通です。
- 提供元を選び、アカウントを作ります。使いたいモデルがあるかを先に確かめます。
- 支払い方法を登録します。前払いか後払いか、通貨が円かドルかで、予算の管理のしかたが変わります。
- APIキーを発行します。キーは環境変数やシークレットの管理機能に保管し、ソースコードとは切り離して扱います。漏れたキーで使われた分も、キーの持ち主に請求されます。
- 最初のリクエストを送ります。短い質問を送り、回答とトークン数が返ってくることを確かめます。FastMetalでの手順はAPIのはじめ方にまとめています。
- 利用量を確認します。モデル別、日別の使用量を見て、想定した費用に収まっているかを確かめます。
社内の業務で使うなら、送ってよいデータの範囲も最初に決めておきます。
LLM APIを比較するときの6つの確認点
提供元を選ぶときは、次の6点を確かめておくと判断しやすくなります。
| 確認点 | 確かめること |
|---|---|
| モデルと機能 | コンテキスト長、ツール呼び出し、画像入力、構造化出力 |
| 料金の単位 | 入力と出力の単価、キャッシュやバッチ処理の割引 |
| 利用の上限 | レートリミット、利用額の上限で実際に止まるか |
| データの扱い | 学習への利用、保存の期間、推論する国 |
| 通貨と支払い方法 | 円かドルか、カードか銀行振込か |
| 適格請求書 | 発行されるか、何社分を受け取ることになるか |
1. 使いたいモデルと機能があるか
モデルの名前に加えて、1回に扱える量(コンテキスト長)や、ツール呼び出し、画像入力、構造化出力への対応も確かめます。同じモデルでも、提供元によって使える機能が異なることがあります。各モデルの対応状況はLLMの比較・一覧で確認できます。
2. 料金の単位と見積もりやすさ
入力と出力の単価に加えて、プロンプトキャッシュやバッチ処理による割引があるかを見ます。見積もりは「1回あたりのトークン数 × 呼び出し回数」で立てます。AIコスト計算ツールを使うと、モデルごとの目安を出せます。
3. レートリミットと利用額の上限
多くのLLM APIには、1分あたりのリクエスト数やトークン数に上限(レートリミット)があり、超えると429エラーが返ります。対処の方法はLLM APIのレートリミットと429エラーで解説しています。
あわせて、利用額に上限をかけられるかも確かめます。後払いの契約では、上限が通知にとどまり、超えた分も請求される場合があります。前払い(プリペイド)なら、残高を使い切った時点でリクエストが止まります。両者の違いはプリペイド型API入門で解説しています。
4. データの取り扱い
送ったデータがモデルの学習に使われるか、どれだけの期間保存されるか、推論がどの国で行われるかを確認します。個人情報や機密情報を扱うなら、提供元の利用規約に必ず目を通します。日本国内で推論するモデルについては、国内で推論するLLMの解説をご覧ください。
5. 請求の通貨と支払い方法
海外の提供元の多くは米ドル建てで、クレジットカード払いが基本です。ドル建てだと為替の動きで毎月の支払額が変わるため、予算を立てにくく、稟議も通しにくくなります。円建てで払えるか、銀行振込が使えるかも確かめておきます。詳しくは円建てで使えるLLM APIで解説しています。
6. 適格請求書(インボイス)が発行されるか
消費税の仕入税額控除を受けるには、適格請求書を受け取れるかが重要です。AnthropicやOpenAIは適格請求書発行事業者として登録しています(2026年10月時点の各社の案内による)。ただ、使う提供元が増えるほど、受け取る請求書も増えていきます。登録の有無は国税庁の適格請求書発行事業者公表サイトで確認できます。
複数社のLLM APIを1つのキーで使うならAIゲートウェイ
要約は軽いモデル、難しいコードは上位のモデルというように、用途ごとに使い分けると品質と費用のつり合いが取りやすくなります。ただし、提供元と個別に契約していると、使う会社が増えるたびに次のような手間が積み重なります。
- 提供元ごとのアカウント作成と、支払い方法の登録
- APIキーの発行と、社内での保管
- リクエスト形式の違いへの対応
- 通貨も締め日も異なる請求書の集計
こうした手間をまとめて引き受けるのが、AIゲートウェイです。アプリはゲートウェイのエンドポイントだけを呼び、どの会社のモデルを使うかは model の値で指定します。APIキー、請求、利用状況の確認が1か所にまとまります。仕組み、主な機能、日本で選ぶときの確認点は、AIゲートウェイとはで詳しく解説しています。
FastMetalでLLM APIを使う
FastMetalは、25のプロバイダーが提供する95以上のLLM・生成AIモデルを、1つのAPIキーで呼び出せる日本のAIゲートウェイです。
- OpenAI互換とAnthropic互換の両方のAPIを用意しています。OpenAI互換のベースURLは
https://api.fastmetal.ai/v1です。 - Anthropic、OpenAI、Google、DeepSeek、xAI、Moonshot AI、Z.aiなどのモデルを、
modelの値を変えるだけで切り替えられます。モデルIDはLLMの比較・一覧で確認できます。 modelにautoを指定すると、ツール、画像、JSONといったリクエストの条件を満たすモデルのうち、最も安いものに振り分けます。失敗したときは次の候補に切り替わり、料金は選ばれたモデルの単価で計算されます。- 料金は円建てのプリペイドで、使ったトークンの分だけ残高から差し引かれます。FastMetalに支払うのは、チャージしたクレジットの代金(消費税込み)だけです。
- 支払いはカードか銀行振込(前払い)で、最低購入額は¥500です。クレジットを購入するたびに適格請求書を発行します(登録番号 T5010001015990)。
- APIキーを複数発行し、キーごとに残高の上限を決められます。チャージした残高がそのまま上限になるため、残高を超える請求は起こりません。
- FastMetalがお客様のデータをモデルの学習に使うことはありません。リクエストは各モデルの提供元に中継され、提供元側での扱いはその提供元のポリシーに従います。
モデルごとの円建ての単価は料金ページに掲載しています。
よくある質問
LLM APIとは何ですか?
大規模言語モデル(LLM)を、自分のアプリやシステムからプログラムで呼び出すための窓口です。モデルの名前と会話の内容をJSONで送ると、生成された文章と使ったトークン数がJSONで返ってきます。
LLM APIの料金はどのように決まりますか?
多くの提供元は、トークン単位の従量課金を採用しています。入力と出力それぞれに100万トークンあたりの単価が決まっていて、出力のほうが高く設定されるのが一般的です。具体的な単価は、各提供元の公式の料金ページで確認してください。
チャット画面の有料プランがあれば、APIも使えますか?
多くの提供元では、チャット画面の定額プランとAPIの利用料は別々の契約です。APIを使うには、APIのアカウントで支払い方法を登録し、APIキーを発行します。
無料で使えるLLM APIはありますか?
無料枠を設けている提供元や、無料で呼び出せるモデルがあります。FastMetalはアカウントの作成が無料で、無料モデルは¥0で使えます。提供元の無料枠には1日の回数や速度に上限があることが多いため、業務やエージェントで使い続けるなら、有料のモデルを前提に計画を立てるのが安全です。
LLM APIを比較するときは、何を見ればよいですか?
モデルと対応機能、料金の単位、レートリミットと利用額の上限、データの扱い、請求の通貨と支払い方法、適格請求書の有無の6点です。性能に加えて支払いと経理の条件まで比べておくと、導入がスムーズに進みます。
複数社のLLM APIを1つのAPIキーで使えますか?
AIゲートウェイを使えば可能です。FastMetalなら、25のプロバイダーが提供する95以上のモデルを、1つのAPIキーとOpenAI互換のエンドポイントで呼び出せます。モデルはmodelの値を変えるだけで切り替えられ、請求も円建てで1つにまとまります。
FastMetalでLLM APIを試す
無料でアカウントを作成 | 料金を見る | モデル一覧を見る
アカウントを作成してAPIキーを発行すれば、この記事のコード例で model を好きなモデルに替えて試せます。