← ブログに戻る
新モデル

考えすぎない推論モデル「Ember-1」が利用可能になりました

FastMetal

Fireworks の Ember-1(ember-1)が FastMetal で利用可能になりました。Fireworks の研究チームが Kimi K3 をもとに訓練した推論モデルで、狙いは「考える量を減らしても答えの質を落とさない」ことです。

特徴

  • 推論トークンが少ない — Fireworks によると、Kimi K3 と比べて推論に使うトークンを約40%減らしています。顧客環境での A/B テストでも、同程度の品質でタスクあたり約35%少なかったとしています。推論モデルの料金は出力トークンで決まるため、この差はそのまま1回あたりの料金に効きます。
  • コーディングとエージェント向け — Fireworks の公表値では、SWE-bench Verified が92.2%(Kimi K3 最大設定は93.2%)、Terminal Bench 2.1 が82.0%(同80.9%)です。
  • 画像入力・ツール呼び出し・構造化出力 — FastMetal 経由の実際の呼び出しで、画像の読み取り、ツール呼び出し、json_schema 指定の出力をそれぞれ確認しています。
  • 100万トークンの文脈 — コンテキスト長は1,048,576トークンです。

推論モデルなので、短い質問でも考えてから答えます。「日本の首都は?」には43トークン考えたうえで「東京」と返しました。

使い方

ほかのモデルと同じ OpenAI 互換のエンドポイントに、model を ember-1 にして送るだけです。

curl https://api.fastmetal.ai/v1/chat/completions \
  -H "Authorization: Bearer $FASTMETAL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "ember-1",
    "messages": [
      {"role": "user", "content": "この関数のバグを見つけて修正してください:\n\ndef mean(xs):\n    return sum(xs) / len(xs) - 1"}
    ]
  }'

料金と提供条件

項目内容
入力100万トークンあたり ¥536.1(税別)
出力100万トークンあたり ¥2,680.5(税別)
コンテキスト1,048,576トークン

入力単価は Kimi K3 より高いため、安くなるかどうかは推論の短さで取り戻せるかによります。出力、とくに推論が長くなりがちな作業ほど効果が出やすいはずです。同じ質問への実際の回答は Ember-1 と Kimi K3 の比較ページで見比べられます。

なお Fireworks は Ember-1 を研究プレビューとして公開しています。提供期間はまず2週間で、その後も提供を続けるかは利用状況で決めるとしています。提供が終了した場合は FastMetal でも利用できなくなりますので、本番のワークロードに組み込む際はその点をご了承ください。

もっと詳しく

Ember-1を今すぐ試す

Ember-1はFastMetalのAPIキー1つで利用できます。ブラウザですぐに試す、またはOpenAI SDKからそのまま呼び出せます。