毎朝更新
← 今日のニュース2026.08.13 / Fujin編集約8分で読めます

DeepSeek V4 Proが正式版へ——「エージェント性能向上」を数字だけで判断してはいけない理由

DeepSeekの新しい数字は確かに目を引きます。でも本当に見るべきなのは、単発の質問に正解したかではなく、AIが長い作業をどこまで崩さず続けられるようになったかです。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    DeepSeekは2026年8月13日、DeepSeek-V4-Proのプレビュー版を置き換える正式版「DeepSeek-V4-Pro-0813」を、公式Hugging Faceで公開しました。重みはMITライセンスで提供されています。

  • 02

    公式モデルカードでは、端末操作やコード修正など、AIが複数の手順を進める評価でプレビュー版を上回ったと説明しています。最大約100万トークンの長い入力と、3段階の推論強度にも対応します。

  • 03

    ただし、評価はDeepSeek自身が指定した仕組みと条件で測ったものです。一部には非公開の社内テストも含まれ、私たちの仕事で同じ改善率が出ると独立確認されたわけではありません。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

AIエージェント
質問へ一度答えるだけでなく、計画を立て、検索や端末などの道具を使い、複数の手順を進めるAIです。新人へ仕事を一式渡す場面に近く、途中で迷わない力も問われます。
コンテキスト長
AIが一度に参照できる情報量です。モデル設定は1,048,576トークンで、公式は約100万トークン対応と説明します。ただし長く入ることと、全内容を正しく使えることは別です。
投機的デコード
次に出そうな語を補助機構が先回りして候補にし、本体がまとめて確認する高速化の方法です。今回のDSparkはモデルに付加された専用の仕組みで、答えの正しさそのものを保証しません。
ベンチマーク
共通の問題でAIを比べる試験です。学校の模試のように比較には便利ですが、問題、道具、制限時間、採点方法が変われば点数も変わるため、実務の結果とは分けて読みます。

03 / THE FACTS

何が起きたのか

公式Hugging Faceのモデルページは、8月13日3時05分UTC、日本時間12時05分に作成されました。DeepSeekは0813版をV4-Proの公式リリースと位置づけ、以前のPreviewを置き換えると明記しています。

モデル設定では最大1,048,576トークンを扱い、推論に使う時間や計算量を調整するreasoning effortはlow、high、maxの3段階です。難しい仕事ほど多く考えさせる選択肢ですが、長く考えれば必ず正しくなるわけではありません。

公式値ではTerminal Bench 2.1が87.9で、Previewの72.1を上回りました。NL2Repoは61.5対38.5、Cybergymは83.3対52.7、DeepSWEは62.7対12.8、Toolathlon-Verifiedは74.1対55.9です。

知識と推論を測るHLEは、ツールなし42.7、ツールあり60.0でした。Previewは37.7と48.2です。これはツールを正しく選んで使うと結果が変わることを示す一方、評価環境の設計も点数へ強く影響します。

コードエージェント評価はDeepSeek Harnessのminimal mode、max推論、temperature 1.0、top_p 0.95という条件です。DSBenchの二つは社内データで、外部から同条件を完全再現できません。

THE CONCLUSION

つまり、何が重要なのか

DeepSeek-V4-Pro-0813は、4月に出たV4-Pro Previewの構造を基に、エージェント作業を強化して正式版にしたモデルです。公式モデルカードは、DSparkという投機的デコード機構を加え、端末、コード、ツール利用の複数評価で前版を上回ったと説明しています。

一方で、これは『どんな会社でもAI業務がすぐ成功する』という発表ではありません。公開されたのはモデルと開発元による評価です。自分の業務で使うなら、同じ課題を旧版と新版へ渡し、正確さ、待ち時間、費用、手直しを一緒に測る必要があります。

04 / THE CONTEXT

なぜ、今これが重要なのか

AIの競争は、短い質問への回答から、数十分以上かけてファイルを調べ、コードを書き、テストする仕事へ移っています。そこで必要なのは、一問だけの知識より、途中の情報を保ちながら道具を使う力です。

長い入力への対応も同じ流れです。大きな資料やリポジトリを一度に渡せると便利ですが、入る量が増えるほど、重要な指示を見失ったり、古い情報を使ったりする危険も増えます。

さらに、オープンウェイトなら企業が自分の環境へ置き、挙動を調べられます。ただし公式の起動例は4基のNVIDIA GB300を使う構成で、一般的な個人PCで気軽に動かす規模ではありません。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

APIを使う人は、サービス名がV4-Proでも、実際に0813版へ更新されたかを提供元で確認する必要があります。今回のモデル公開だけでは、DeepSeek APIの切替日時や価格変更までは確認できません。

自社運用を検討する人には、MITライセンスと公開重みが選択肢になります。一方、保存容量、複数GPU、推論ソフト、監視まで必要で、『無料で公開』と『安く運用』は同じ意味ではありません。

導入判断では、公開点数より自社課題を優先しましょう。顧客資料の整理、既存コードの修正、調査レポートなど実際の3課題で、完了率だけでなく誤りと人の修正時間を測ると現実が見えます。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    利用中のAPIや社内環境で、モデル名、提供版が0813版を指すか確認する。

  2. 02

    自分の仕事から難易度の違う3課題を選び、旧版と0813版へ同じ条件で依頼する。

  3. 03

    正解率だけでなく、処理時間、利用料金、人が直した回数、途中停止の有無を表にして比較する。

BOTTOM LINE

DeepSeek-V4-Pro-0813の価値は、派手な点数より、長いAI作業を前へ進める設計にあります。導入の答えは、公開表ではなく自分の課題で確かめましょう。

今日のAIニュース一覧へ →