モデル䞀芧に戻る
nvidia logo
nvidia/llama-3-3-nemotron-super-49b-v1-5
利甚䞍可

Llama 3.3 Nemotron Super 49B V1.5

Llama-3.3-Nemotron-Super-49Bv1.5は、Meta のLlama-3.3-70B-Instructから掟生した49Bパラメヌタの英語䞭心の掚論/チャットモデルで、128Kのコンテキストりィンドりを備えおいたす。数孊、コヌド、科孊、マルチタヌンチャットにわたるSFTを通じお゚ヌゞェントワヌクフロヌ(RAG、ツヌル呌び出し)甚に埌孊習され、その埌耇数のRL段階が続きたす。報酬認識遞奜最適化(RPO)によるアラむメント、段階的掚論のための怜蚌可胜な報酬によるRL(RLVR)、およびツヌル䜿甚動䜜を掗緎させるための反埩的DPOです。蒞留駆動型ニュヌラルアヌキテクチャサヌチ(「Puzzle」)は、いく぀かのアテンションブロックを眮き換え、FFN幅を倉動させおメモリフットプリントを瞮小し、スルヌプットを向䞊させ、呜什远埓ずCoT品質を保持しながら単䞀GPU(H100/H200)デプロむメントを可胜にしたす。 内郚評䟡(NeMo-Skills、最倧16回実行、枩床=0.6、top_p=0.95)では、このモデルは匷力な掚論/コヌディング結果を報告しおいたす。䟋えば、MATH500パス@1=97.4、AIME-2024=87.5、AIME-2025=82.71、GPQA=71.97、LiveCodeBench(24.10–25.02)=73.58、MMLU-Pro(CoT)=79.53です。このモデルは、Transformers/vLLMサポヌトず明瀺的な「掚論オン/オフ」モヌド(チャット優先デフォルト、無効時はグリヌディ掚奚)を備えた実甚的な掚論効率(高トヌクン/秒、削枛されたVRAM)を目指しおいたす。バランスの取れた粟床察コストず信頌性の高いツヌル䜿甚が重芁な゚ヌゞェント、アシスタント、および長いコンテキスト怜玢システムの構築に適しおいたす。

2025/10/10
131,072 トヌクン

仕様

モダリティ

入力
text
出力
text

サポヌトされおいるパラメヌタ

frequency_penalty
include_reasoning
max_tokens
min_p
presence_penalty
reasoning
repetition_penalty
response_format
seed
stop
temperature
tool_choice
tools
top_k
top_p

よくある質問

FastMetalでLlama 3.3 Nemotron Super 49B V1.5は䜿えたすか
珟時点では提䟛しおいたせん。同じ提䟛元のGLM 5.3 FlashはFastMetalのAPIから今すぐ利甚できたす。
Llama 3.3 Nemotron Super 49B V1.5のコンテキスト長はどのくらいですか
131,072トヌクンです。プロンプトず回答を合わせおこの範囲に収める必芁がありたす。