16件のモデル
DeepSeek V4.1 Flash
deepseek-v4.1-flashDeepSeek V4.1 Flashはディープシークの疎混合専門家モデルであり、同社のCausal Encoder-Decoder (CED)アーキテクチャ上に構築された最初のモデルです。入力時に8Bパラメータを活性化し、出力時に16Bを...
DeepSeek V4 Flash
deepseek-v4-flashDeepSeek V4 Flashは、DeepSeekの効率最適化されたMixture-of-Expertsモデルで、総パラメータ数284B、アクティブ化されたパラメータ数13Bを備えており、100万トークンのコンテキストウィンドウに対応しています。高速推論用に設計されており...
DeepSeek V4 Pro
deepseek-v4-proDeepSeek V4 Proは、DeepSeekの大規模混合専門家モデルで、総パラメータ数1.6T、アクティブ化されたパラメータ数49Bを備えており、100万トークンのコンテキストウィンドウをサポートしています。高度な推論、コーディングなどのために設計されています。
DeepSeek V3.2
deepseek/deepseek-v3.2DeepSeek-V3.2は、高い計算効率と強力な推論およびエージェント的ツール使用性能を調和させるように設計された大規模言語モデルです。DeepSeek Sparse Attention(DSA)という細粒度のスパース注意メカニズムを導入しており、長文脈シナリオにおいて品質を保ちながら訓練と推論のコストを削減します。
DeepSeek V3.2 Speciale
deepseek/deepseek-v3.2-specialeDeepSeek-V3.2-Specialeは、最大限の推論と自律型エージェント性能に最適化されたDeepSeek-V3.2の高計算量バリアントです。効率的な長文脈処理のためのDeepSeek Sparse Attention(DSA)に基づいており、その後、ポストトレーニング強化学習をスケーリングして、ベースモデルを超える能力を実現します。
DeepSeek V3.2 Exp
deepseek/deepseek-v3.2-expDeepSeek-V3.2-Expは、DeepSeekがV3.1と将来のアーキテクチャの中間段階として公開した実験的な大規模言語モデルです。DeepSeek Sparse Attention(DSA)を導入しており、これは長文脈シナリオにおけるトレーニングと推論の効率を改善しながら出力品質を維持するために設計された細粒度のスパースアテンションメカニズムです。ユーザーは`reasoning`の`enabled`ブール値を使用して推論動作を制御できます。
DeepSeek V3.1 Terminus
deepseek/deepseek-v3.1-terminusDeepSeek-V3.1 Terminusは、[DeepSeek V3.1](/deepseek/deepseek-chat-v3.1)のアップデートで、モデルの元の機能を維持しながら、言語の一貫性とエージェント機能を含むユーザーから報告された問題に対処し、コーディングおよび検索エージェントにおけるモデルのパフォーマンスをさらに最適化しています。671Bパラメータ(37Bアクティブ)の大規模ハイブリッド推論モデルで、思考モードと非思考モードの両方をサポートしています。
DeepSeek V3.1 Terminus (exacto)
deepseek/deepseek-v3.1-terminus:exactoDeepSeek-V3.1 Terminusは、[DeepSeek V3.1](/deepseek/deepseek-chat-v3.1)のアップデートで、モデルの元の機能を維持しながら、言語の一貫性とエージェント機能を含むユーザーから報告された問題に対処し、コーディングおよび検索エージェントにおけるモデルのパフォーマンスをさらに最適化しています。
DeepSeek V3.1
deepseek/deepseek-chat-v3.1DeepSeek-V3.1は、プロンプトテンプレートを介して思考モードと非思考モードの両方をサポートする大規模ハイブリッド推論モデル(6710億パラメータ、370億アクティブ)です。DeepSeek-V3ベースを拡張し、2段階の長文脈トレーニングプロセスで最大128Kトークンに対応し、効率的な推論のためにFP8マイクロスケーリングを使用しています。ユーザーは`reasoning` `enabled`ブール値を使用して推論動作を制御できます。
R1 0528
deepseek/deepseek-r1-05285月28日更新:[オリジナルDeepSeek R1](/deepseek/deepseek-r1)は[OpenAI o1](/openai/o1)と同等のパフォーマンスを実現していますが、オープンソース化され、推論トークンが完全に公開されています。パラメータサイズは671Bで、推論パスでは37Bがアクティブです。 完全にオープンソースのモデルです。
DeepSeek V3 0324
deepseek/deepseek-chat-v3-0324DeepSeek V3は、685Bパラメータの混合専門家モデルであり、DeepSeekチームのフラッグシップチャットモデルファミリーの最新版です。 [DeepSeek V3](/deepseek/deepseek-chat-v3)モデルの後継であり、様々なタスクで優れたパフォーマンスを発揮します。
R1 Distill Qwen 32B
deepseek/deepseek-r1-distill-qwen-32bDeepSeek R1 Distill Qwen 32Bは、[Qwen 2.5 32B](https://huggingface.co/Qwen/Qwen2.5-32B)をベースとした蒸留大規模言語モデルで、[DeepSeek R1](/deepseek/deepseek-r1)の出力を使用しています。様々なベンチマークでOpenAIのo1-miniを上回り、密集型モデルの新しい最先端の結果を達成しています。
R1 Distill Llama 70B
deepseek/deepseek-r1-distill-llama-70bDeepSeek R1 Distill Llama 70Bは、[Llama-3.3-70B-Instruct](/meta-llama/llama-3.3-70b-instruct)に基づいた蒸留大規模言語モデルで、[DeepSeek R1](/deepseek/deepseek-r1)の出力を使用しています。
R1
deepseek/deepseek-r1DeepSeek R1がここにあります:[OpenAI o1](/openai/o1)と同等のパフォーマンスですが、オープンソース化され、完全にオープンな推論トークンを備えています。パラメータサイズは671Bで、推論パスで37Bがアクティブです。 完全にオープンソースのモデル&[技術レポート](https://api-docs.deepseek.com/news/news250120)。 MITライセンス:自由に蒸留・商用化できます!
DeepSeek V3
deepseek/deepseek-chatDeepSeek-V3は、DeepSeekチームの最新モデルであり、前のバージョンの指示追従能力とコーディング能力を基盤としています。約15兆トークンで事前学習されており、報告された評価によると、このモデルは他のオープンソースモデルを上回り、主要なクローズドソースモデルに匹敵します。
deepseek-v4-flash-0731
deepseek-v4-flash-0731Global: DeepSeek V4 Flash 0731 - 高速・低コストなモデル