毎朝更新
← 今日のニュース2026.08.21 / Fujin編集約7分で読めます

AIに資料を読ませるなら構造化、文章を書かせるなら普通の文——品質が74%から48%へ落ちた理由

長い表を読むAIと、その内容から提案書を書くAI。同じ『分かりやすい形式』を渡せばよさそうですが、今回の実験は役割ごとに正解が違うと示しました。

01 / QUICK GUIDE

まず、30秒でつかむ

  • 01

    研究チームは、実際の入札書類を扱うAIを検証しました。表や文書の階層を残すと、質問や回答欄を見つける読み取り作業は安定しました。

  • 02

    一方、執筆のための同じ指示を普通の文章から入れ子のXMLへ変えると、十分に回答できた割合は23/31から15/31、約74%から48%へ下がりました。

  • 03

    ただし、単一案件を各31回試した査読前研究です。『XMLは悪い』ではなく、探す資料は構造化し、書くための方針は自然な文章で渡すという仮説として読むべきです。

02 / KEY WORDS

専門用語を、やさしく。

ここだけ押さえれば、残りの本文はスムーズに読めます。

マルチエージェント
一つのAIに全部任せず、資料整理、回答作成、確認などの役割を分けて連携させる仕組みです。
XML
情報をタグで囲み、親子関係を表す記述形式です。表の見出しや項目の階層を機械に伝えやすくします。
LLM-as-a-Judge
大規模言語モデル、つまり文章AIに別のAIの回答を採点させる方法です。速い反面、好みや同系統モデルへの偏りが残ります。

03 / THE FACTS

何が起きたのか

8月21日、豪州のML Research Labsの研究者3人が、入札回答を作るAIシステムの検証結果をarXivへ投稿しました。査読を終えた論文ではなくプレプリントです。

システムは43個の単発役割と一つの対話型執筆役を、6段階・3回の人間確認でつなぎます。豪州内で動く、2000億パラメーター未満の公開型モデルを使いました。

過去の模範回答を見せない条件で、人間が提出した55節と比較しました。AI評価者は40節を人間以上、15節を弱い、欠落はゼロと判定し、根拠の薄い主張を一件指摘しました。

弱いとされた回答の差70件を調べると、48件、68%はAIへ渡した資料に情報自体がありませんでした。資料にあったのに使えなかった差は15件、21%です。

読み取り作業では構造化が効きました。たとえば注釈を正しい質問へ結び付ける割合は61%から97.8%へ上がり、表計算の回答欄も3回とも310件でそろいました。

ところが執筆指示では逆でした。同じ内容を普通の文章と入れ子XMLで各31回渡すと、十分な回答は23回から15回へ減り、質問文を言い直すだけの文章も増えました。

THE CONCLUSION

つまり、何が重要なのか

この論文の要点は、構造化の効果が作業によって非対称だったことです。情報の場所を探す段階では構造が助けになり、文章の方向を決める段階では目立つ語を偏らせました。

実務では、入力を一つの巨大なXMLへまとめるより、資料の検索用データと、執筆方針のメモを分ける設計から試す価値があります。

04 / THE CONTEXT

なぜ、今これが重要なのか

会社のAIは、チャットで一問ずつ聞く段階から、資料を読み、複数のAIが引き継いで報告書を作る段階へ進んでいます。そこで、情報の渡し方が品質を左右します。

XMLでは依頼者を表すタグが上位に置かれ、その語が文章の主語として目立った可能性があります。実際、依頼者を主語にして要求を言い直す書き出しは4回から10回へ増えました。

禁止表現を名前付きで強調する方法にも落とし穴がありました。残った不具合26件のうち25件、96%が、指示で具体的に名指しした二つの形に集中しました。

なお74%対48%は、単一の調達案件を各31回試した結果です。同系統のAIが採点し、人間の盲検採点もないため、大差に見えても一般法則と断定はできません。

05 / WHAT IT MEANS FOR YOU

私たちには、何が変わる?

社内規程や表を検索させるときは、見出し、行、セルの関係を残します。反対に『誰に、何を、どの順で伝えるか』という執筆方針は、短い自然な文章で別に渡します。

AIの回答が人間より弱いとき、すぐモデルやプロンプトを責めないことも重要です。元資料に必要な事実があるかを先に確認すれば、情報不足と文章力不足を分けられます。

避けたい表現は、禁止語を何度も書くより、完成文へ適用する確認手順に変えます。論文では『要求文由来の語を消しても具体性が残るか』という自己テストが改善につながりました。

本番導入では一回の成功例より、同じ入力を複数回流した差を見ます。論文でも回答欄が54件と56件に揺れただけで、後段の質問数が68件から51件へ広がりました。

07 / NEXT ACTION

今日から、どう動くか

  1. 01

    社内AIの入力を、探すための資料と、書くための指示に分け、現在どの形式で渡しているかを書き出す。

  2. 02

    同じ10件の仕事を、執筆指示が自然文の版とXMLの版で試し、人間が回答品質と言い直しの量を比べる。

  3. 03

    不足した回答を、元資料に情報がない、情報はあるが使えない、文章が悪いの三つに分類して改善先を決める。

BOTTOM LINE

AIへ渡す情報は、全部を同じ形にそろえる必要はありません。資料は構造化して探しやすくし、文章の狙いは自然な言葉で伝える。その分業が、品質改善の出発点です。

今日のAIニュース一覧へ →