01 / QUICK GUIDE
まず、30秒でつかむ
- 01
Tencentは8月28日、大規模言語モデル「Hy4 preview」を発表し、通常版とFP8版のモデル重みを公開しました。
- 02
モデル全体は770Bですが、1つの単語を処理するときに使う部分は49Bです。長い入力を受ける枠は1Mトークンです。
- 03
社内比較では競合モデルをわずかに上回りました。ただし点差は小さく、第三者が同じ結果を確かめた評価ではありません。
02 / KEY WORDS
専門用語を、やさしく。
ここだけ押さえれば、残りの本文はスムーズに読めます。
- パラメータ
- AIが学習で調整した数値の集まりです。数が多いほど必ず賢いわけではなく、学習データや設計、使い方も結果を左右します。
- MoE
- Mixture of Experts、つまり複数の専門部分から入力に合う一部を選んで使う設計です。巨大なモデル全体を毎回動かさずに済みます。
- コンテキスト長
- AIが一度のやり取りで受け取れる文章量の上限です。長い入力が入ることと、その全箇所を正しく思い出せることは別です。
- FP8
- 数値を8ビットで表し、モデルを軽く動かしやすくする形式です。必要な機器や品質への影響は、実際の環境で確かめる必要があります。
03 / THE FACTS
何が起きたのか
Tencentは8月28日8時48分45秒(協定世界時)、Hy4 previewを公式サイトで発表しました。通常版とFP8版のモデル重みも複数の配布先で公開しています。
Hy4はMoE型で、モデル全体の規模は770B、つまり7700億パラメータです。ただし、1トークンを処理するときに実際に選ばれる部分は49Bです。
たとえるなら、770Bは会社全体の知識、49Bは一つの案件に参加する担当チームです。毎回770Bを全部計算する、という意味ではありません。
コンテキスト長は1M、約100万トークンです。長い文書やコードをまとめて入力できる設計ですが、どの位置の情報にも同じ精度で答える保証値ではありません。
通常版とFP8版の重みはHugging Faceなどで公開され、ライセンスはApache 2.0です。オープンウェイトでも、770B級を個人PCで手軽に動かせるとは限りません。
Tencentは、コード、オフィス文書、ゲーム開発、科学研究を重点用途として説明しています。これらは会社が示した想定用途であり、利用者の現場での成果ではありません。
つまり、何が重要なのか
この発表の要点は、770Bという見出しより、必要な専門部分だけを選ぶ49Bの設計と、1Mトークンの長い入力枠を組み合わせたことです。
一方、previewは完成版ではありません。Tencent自身も考えすぎや確認のしすぎを弱点に挙げており、社内評価の小さな差だけで優劣を決める段階ではありません。
04 / THE CONTEXT
なぜ、今これが重要なのか
AIは短い質問への回答だけでなく、複数の資料を読み、作業を続ける方向へ進んでいます。入力枠が長いモデルは、その土台として注目されています。
ただし、長い資料を丸ごと渡すほど、AIが根拠を取り違えたときに人が気づきにくくなります。容量の拡大と、引用箇所を確認する仕組みはセットです。
MoEは大きな知識の器と計算量の両立を狙う設計です。そのため総規模だけでなく、実際に使う部分、必要な機器、待ち時間も一緒に見る必要があります。
モデルの発表が相次ぐ時期ほど、社内比較の順位が独り歩きします。評価者、課題、採点方法を確認しない数字は、購入や導入の結論にできません。
05 / WHAT IT MEANS FOR YOU
私たちには、何が変わる?
Tencentの社内盲検比較では、163人が203件の課題を評価し、平均点はHy4が2.99、GLM 5.3が2.92、Kimi K3が2.94でした。
差は0.05〜0.07点です。課題や採点尺度が外部で独立再現されたとは確認できないため、『明確に勝った』ではなく『社内比較で僅差』と読みます。
1Mトークンを仕事で試すなら、資料を入れるだけで終えません。回答ごとにページや段落を示させ、重要な数字は原文と照合する工程を残します。
自社で動かす場合は、重みを取得できることと、現実的な費用で運用できることを分けます。必要なGPU、速度、保守の人手まで含めて比較します。
07 / NEXT ACTION
今日から、どう動くか
- 01
長い資料を1本選び、回答と一緒に根拠のページ番号や引用箇所を返すよう指示する。
- 02
社内比較の順位ではなく、自社の代表的な3課題を同じ条件で複数モデルへ試す。
- 03
自社運用を検討するなら、GPU、応答時間、電力、保守担当を含む総費用を見積もる。