考えすぎない推論モデル「Ember-1」が利用可能になりました
Fireworks の Ember-1(ember-1)が FastMetal で利用可能になりました。Fireworks の研究チームが Kimi K3 をもとに訓練した推論モデルで、狙いは「考える量を減らしても答えの質を落とさない」ことです。
特徴
- 推論トークンが少ない — Fireworks によると、Kimi K3 と比べて推論に使うトークンを約40%減らしています。顧客環境での A/B テストでも、同程度の品質でタスクあたり約35%少なかったとしています。推論モデルの料金は出力トークンで決まるため、この差はそのまま1回あたりの料金に効きます。
- コーディングとエージェント向け — Fireworks の公表値では、SWE-bench Verified が92.2%(Kimi K3 最大設定は93.2%)、Terminal Bench 2.1 が82.0%(同80.9%)です。
- 画像入力・ツール呼び出し・構造化出力 — FastMetal 経由の実際の呼び出しで、画像の読み取り、ツール呼び出し、
json_schema指定の出力をそれぞれ確認しています。 - 100万トークンの文脈 — コンテキスト長は1,048,576トークンです。
推論モデルなので、短い質問でも考えてから答えます。「日本の首都は?」には43トークン考えたうえで「東京」と返しました。
使い方
ほかのモデルと同じ OpenAI 互換のエンドポイントに、model を ember-1 にして送るだけです。
curl https://api.fastmetal.ai/v1/chat/completions \
-H "Authorization: Bearer $FASTMETAL_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "ember-1",
"messages": [
{"role": "user", "content": "この関数のバグを見つけて修正してください:\n\ndef mean(xs):\n return sum(xs) / len(xs) - 1"}
]
}'
料金と提供条件
| 項目 | 内容 |
|---|---|
| 入力 | 100万トークンあたり ¥536.1(税別) |
| 出力 | 100万トークンあたり ¥2,680.5(税別) |
| コンテキスト | 1,048,576トークン |
入力単価は Kimi K3 より高いため、安くなるかどうかは推論の短さで取り戻せるかによります。出力、とくに推論が長くなりがちな作業ほど効果が出やすいはずです。同じ質問への実際の回答は Ember-1 と Kimi K3 の比較ページで見比べられます。
なお Fireworks は Ember-1 を研究プレビューとして公開しています。提供期間はまず2週間で、その後も提供を続けるかは利用状況で決めるとしています。提供が終了した場合は FastMetal でも利用できなくなりますので、本番のワークロードに組み込む際はその点をご了承ください。
もっと詳しく
- モデルの仕様と料金は Ember-1 のモデルページにまとめています。
- ほかのモデルはモデル一覧、料金の仕組みは料金ページをご覧ください。