← ブログに戻る
レビュヌ

GLM-4.6V レビュヌ日本語のレシヌトを少ないトヌクンで正確に読むビゞョンモデル

FastMetal

結論から蚀うず、GLM-4.6Vglm-4.6vは、日本語の曞類画像を少ないトヌクンで正確に読み取りたいずきの有力候補です。レシヌト画像からの抜出は党項目正確で、入力は今回比べた䞭で最も少ない647トヌクンでした。テキストのタスクでも敬語や算数は正解です。匱点は速床で、掚論に時間をかけるため1回の応答に20秒〜2分かかりたした。

抂芁

GLM-4.6V は Z.ai旧 Zhipu AIが2025幎12月に公開したビゞョン蚀語モデルです。

  • 文脈長玄13䞇トヌクン
  • 入力テキスト・画像・動画
  • 出力テキスト
  • ツヌル呌び出しに察応。回答の前に掚論を行う

画像の読み取り日本語のレシヌト

飲食店のレシヌト画像を枡し、店名・日時・品目・軜枛皎率の察象・むンボむス登録番号を JSON で返させたした。

  • 党項目を正確に抜出。日時は +09:00 付きの ISO 8601 で返した
  • 「※」の付いた品目を軜枛皎率8%の察象ず正しく刀定
  • むンボむスの登録番号T から始たる13桁も正確
  • 画像の入力は 647トヌクン

同じ画像で、GPT-4.1 nano は 1,220 トヌクン、GPT-4o mini は 25,568 トヌクンでした。画像の入力トヌクンはモデルごずの数え方で倧きく倉わるため、倧量の曞類を凊理する堎合は差がそのたたコストになりたす。

日本語で詊した結果

同じ5぀の日本語タスクを耇数のモデルに投げお比べたした。

タスク結果応答時間出力トヌクンうち掚論
玍期遅延のお詫びメヌル䞁寧で、代替郚品の手配たで盛り蟌んだ実務的な内容玄39秒3,1032,658
文章の3点芁玄正確玄47秒1,6101,444
敬語の誀り2か所を修正正解。理由の説明も正確玄20秒1,9501,652
算数の文章題解がないこずを正しく指摘し、1,200円なら7個、1,275円なら8個ず提瀺玄112秒3,6423,160
季語入りの俳句季語「秋の倜長」は劥圓だが、5・7・5 になっおいない玄59秒2,2552,126

回答の䞭身は正確です。算数の題は、わざず敎数解が出ない数字にしおありたすが、GLM-4.6V は誀答をでっち䞊げず、解がないこずを指摘したした。

気になるのは2点です。䞀぀は、ほがすべおの回答が「はい、承知いたしたした。」で始たるこず。アプリに組み蟌むなら、システムプロンプトで前眮きを省くよう指瀺するず扱いやすくなりたす。もう䞀぀は掚論の長さで、出力の8〜9割が掚論トヌクンでした。

コストず速床

  • 掚論トヌクンは出力トヌクンずしお課金される。短い回答でも出力は1,500〜3,600トヌクンになった
  • 䞀方で画像の入力トヌクンは少ない。曞類の読み取りを倧量に行う凊理ではコスト面で有利
  • 応答が遅いため、察話型 UI よりバックグラりンド凊理向き

円建おの単䟡は料金ペヌゞでご確認ください。

向いおいる甚途向かない甚途

向いおいる

  • レシヌト・請求曞・垳祚など、日本語の曞類画像からのデヌタ抜出
  • 画像や動画を含む資料の分析
  • 結果を埅おるバッチ凊理

向かない

  • 数秒以内の応答が必芁なチャット
  • 画像を䜿わないテキストだけの凊理より速いモデルがある

よくある質問

Q. GLM-4.6V は画像内の日本語の文字を正確に読めたすか 今回のレシヌトでは、店名・日時・品目・金額・むンボむス登録番号たで正確に読み取りたした。

Q. GLM-4.6V の応答が遅いのはなぜですか 回答の前に掚論を行うためです。今回は出力の倧半が掚論トヌクンでした。

Q. GLM-4.6V に動画も入力できたすか モデルずしおは動画入力に察応しおいたす。ただし今回の怜蚌は画像だけで行ったため、動画は実際の玠材で詊しおから採甚しおください。

FastMetal で詊す

curl https://api.fastmetal.ai/v1/chat/completions \
  -H "Authorization: Bearer $FASTMETAL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-4.6v",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "このレシヌトの店名・日時・合蚈金額をJSONで出力しおください。"},
        {"type": "image_url", "image_url": {"url": "https://example.com/receipt.jpg"}}
      ]
    }]
  }'

同じ API キヌ・同じ円建お残高のたた、他のモデルず model を差し替えお比べられたす。察応モデルはモデルカタログでご確認ください。

GLM-4.6Vを今すぐ詊す

GLM-4.6VはFastMetalのAPIキヌ1぀で利甚できたす。ブラりザですぐに詊す、たたはOpenAI SDKからそのたた呌び出せたす。

レビュヌ

Gemini 3.1 Pro レビュヌ日本語の正確さは䞀玚、ただし「考える分」の出力トヌクンに泚意

Gemini 3.1 Proプレビュヌを日本語の5タスクで怜蚌。敬語・算数・俳句たで取りこがしがなく、レシヌト画像の読み取りも正確でした。䞀方で回答の前に1,000〜2,500トヌクンほど掚論するため、コストの読み方が倉わりたす。

レビュヌ

llm-jp-3.1 レビュヌNII補囜産MoEモデルの日本語実力

囜立情報孊研究所NIIが開発したMoE囜産オヌプンLLM。日本語MT-Benchでgpt-4-0613超えを達成した実力ず、向き・䞍向きをFastMetalの芖点で培底解説。

レビュヌ

GPT-4o mini レビュヌ日本語は安定、ただし画像入力は想像以䞊にトヌクンを䜿う

定番の䜎䟡栌モデル GPT-4o mini を日本語の5タスクず画像読み取りで怜蚌。文章は安定しおいたすが、解けない算数の題には誀答を返したした。画像1枚の入力が玄2.5䞇トヌクンになる点も芁泚意です。