AIエージェントがどこまで
自律的に研究ができるか?

トム・ガリー
東京大学 名誉教授
東京大学 グローバル教育センター 特任教授
東京都市大学 教育開発機構 特任教授
第二回「生成AIと教育について考える」ワークショップ
2026年9月11日

自己紹介

辞書編纂者・翻訳者(日→英)
総合文化研究科・教養学部で英語教育・言語教育研究などに従事
論文指導(主査、副査):卒論6名、修論20名、博論25名
2023年〜 生成AIと教育・研究について発信

先行例:Sakana AI「The AI Scientist」

「アイデア→文献調査→実験→執筆→査読」を全自動化
対象は機械学習研究(コードで完結する分野)

最近の動き:数学研究におけるAI

First Proof(6月):未公開の研究レベル問題10問中7問を解決
Terence Tao「Mathematics in the Age of AI」(8月)「証明の希少」から「証明の過剰」へ — 検証・説明・理解・受容が課題に
「人間が説明できない証明は未完成」(Tao)

私の実験:人文・社会系の自律的研究

テーマ提案から論文完成までを自律化(2026年5月、非公開)
主なツール:Claude Code for the Web / Claude Routines(定期実行)/ LLM-wiki(AIが構築する知識データベース)/ GitHub(コード・データの管理)/ OpenRouter(他社モデルの利用)
「テーマ候補 → 計画 → 方法論決定 → 収集・実験・分析 → 解釈 → 執筆・図表作成 → 査読 → 論文完成」を全自動化
他社モデル(GPT、Gemini、DeepSeekなど)が各段階で批評・査読を担当
私の関与はテーマ決定と方向修正のみ

結果例:AIが書いた2本の論文(2026年9月)

形式は整い、限界の記述も誠実 — ただし人間の検証なし、新規性は控えめ
論文の「形」は、すでに自動で作れる

3つの研究プロジェクトの途中経過(論文なし)

AI時代の「意味」の意味(5〜7月、290セッション)
文芸翻訳の評価とワークフロー(7〜9月、256セッション)
翻訳不可能とされる言葉について(8〜9月、61セッション)
設計・実験・検証・執筆はすべてClaude
私はルール設定と監視のみ
失敗したプロジェクトも数件あり

自律的研究の強みと弱み

強み
丁寧・高速・徹底した調査
自己検証がよく機能する
主張が控えめで誠実
弱み
脇道に深入りしすぎる
オフライン資料、有料資料、AIをブロックするサイトなどに届かない
人間の研究者が多少なりとも関与しないと行き詰まることが多い

学術論文の4つの目的

①研究成果の共有
②研究者の評価
③研究プロセスの教育的意味
④研究コミュニティへの参加
自律的研究が満たすのは①だけ? ②③④はどうなる?

課題:卒論・修論・博論の評価

成果物だけでは学生の能力・努力・理解を測れない
AIの利用を禁止しても検出は難しい
「どこまでAIがやったか」は本人にも曖昧
有料モデルの性能差 → 経済格差が成果物に反映
評価の重心を口述試問・研究記録・過程の可視化へ
「自分の言葉で説明できる」ことが最低条件に

AI利用の広大なグレーゾーン

着想・設計
テーマ探し・ブレインストーミング
文献調査・要約・翻訳・先行研究の整理
研究デザイン・仮説
データ・分析
データ収集
コーディング・分類
統計処理
解釈・執筆
結果の解釈・対立仮説の検討
執筆・推敲・図表作成・翻訳
模擬査読・批評・反論の生成
検証・管理
再現・検証・誤り探し
進行管理・研究記録の作成

学生も自律エージェントを使える時代

資金と知識があれば、学生も卒論・修論・博論で自律エージェントを動かせる
建設的な使い方:より充実した、より良い研究を行い、その過程から学ぶ
非建設的な使い方:考える過程・学ぶ過程を省略する
AIの建設的な利用で質の高い学位論文が増えれば、AIを使わない論文が低く評価されるようになる?
論文の指導と審査をどう変えていくか
ご清聴
どうもありがとうございました
トム・ガリー / gally.net
← → / クリックで移動 ・ F で全画面