01 / QUICK GUIDE
まず、30秒でつかむ
- 01
Cloudflareは8月30日、AI Searchの文章生成にGLM-5.3 Flashを使えるようにしたと公式Changelogで発表しました。
- 02
モデルはWorkers AI上で動き、コンテキスト長は1,048,576トークンです。これは一度に参照できる情報量の上限を示します。
- 03
AI Searchでの回答精度、速度、総費用は発表されていません。100万トークンを入れられることと、内容を正確に使えることは別です。
02 / KEY WORDS
専門用語を、やさしく。
ここだけ押さえれば、残りの本文はスムーズに読めます。
- AI Search
- 登録した文書から質問に関係する部分を探し、その情報を使ってAIが回答するCloudflareの検索機能です。現在の公式資料ではベータと表示されています。
- コンテキストウィンドウ
- モデルが一回の処理で参照できる入力、会話履歴、指示などの合計上限です。大きさは理解力や正答率そのものではありません。
- トークン
- AIが文章を処理する細かな単位です。日本語の一文字や一単語と必ず一致せず、同じ文字数でも分割数が変わります。
- 生成モデル
- 検索で見つけた情報を受け取り、最終的な文章回答を作るモデルです。文書を探す処理や並べ替えには別のモデルや設定も使われます。
03 / THE FACTS
何が起きたのか
Cloudflareは8月30日付のChangelogで、AI SearchがGLM-5.3 Flashを文章生成モデルとして新たに扱えるようになったと発表しました。公開時刻は記載されていません。
モデル識別子は@cf/zai-org/glm-5.3-flashです。CloudflareのWorkers AI上で動き、AI Searchのインスタンス設定から生成モデルとして選択できます。
公式モデルページは、コンテキストウィンドウを1,048,576トークンとしています。これは入力、指示、会話履歴などを合わせた処理上限です。
モデルは3200億の総パラメーターを持ち、処理時に使う有効パラメーターは180億と説明されています。数字が大きいほど、すべての仕事で正確とは限りません。
料金は入力100万トークン0.15ドル、出力100万トークン0.50ドル、キャッシュ済み入力100万トークン0.03ドルです。有料プランかAI Gatewayの前払い残高が必要です。
Cloudflareはモデル単体のベンチマーク比較を説明していますが、AI Searchへ組み込んだ場合の検索精度、回答速度、総費用、実利用者数は公表していません。
つまり、何が重要なのか
今回増えたのは、AI Searchの最終回答を作るモデルの選択肢です。GLM-5.3 Flashは1,048,576トークンのコンテキストを持ち、Workers AI上で利用できます。
ただし長い入力は、正確な検索や根拠付き回答を保証しません。AI Search全体では文書の分割、検索、並べ替え、生成がつながるため、モデル一つの数字だけでは品質を判断できません。
04 / THE CONTEXT
なぜ、今これが重要なのか
社内検索では、規程、議事録、製品資料など、長い文書をまたいで答える需要があります。大きなコンテキストは、多くの前提を生成モデルへ渡す余地を増やします。
一方、AI Searchは文書を探して終わりではありません。文書を数値表現へ変え、関連部分を検索し、必要なら並べ替え、最後に文章を作ります。どこか一段が弱ければ回答は崩れます。
だから今の競争は、最長の入力だけでなく、用途に応じて生成モデルを替えられる運用へ進んでいます。Cloudflareはインスタンス全体と一回ごとの指定でモデルを変更できます。
05 / WHAT IT MEANS FOR YOU
私たちには、何が変わる?
100万トークンは、100万文字や100万語という意味ではありません。実際に入る日本語量は文章の種類で変わり、システム指示や回答用の枠も同じ上限を使います。
長い文書を丸ごと渡すより、正しい箇所を検索して短く渡す方が、費用と見落としを抑えられる場合があります。コンテキスト長は検索設計の代わりではありません。
料金表はモデル処理の単価です。AI Search全体では索引作成、検索、並べ替え、保存など別の利用が加わり得るため、掲載単価だけで月額を決められません。
導入判断では、正答率だけでなく出典が合っているかを確認します。同じ質問セットで、現在のモデルとGLM-5.3 Flashの回答、根拠、時間、費用を比べます。
07 / NEXT ACTION
今日から、どう動くか
- 01
社内文書から答えと根拠が確認できる質問を10件作り、現在のモデルの結果を保存する。
- 02
同じ10問をGLM-5.3 Flashで試し、正答、出典、応答時間、入出力トークンを比べる。
- 03
月間質問数と平均トークンからモデル費用を試算し、検索や保存など別料金も確認する。