Upgrade to Pro — share decks privately, control downloads, hide ads and more …

research_os_paper2agent

 research_os_paper2agent

以下のレポジトリで私がプライベートで開発している、Reserach OSと、2026年9月にスタンフォード大の研究者から
発表されたPaper2Agentを融合構想の資料です。

Avatar for Masahiro Muto

Masahiro Muto

September 20, 2026

More Decks by Masahiro Muto

Other Decks in Technology

Transcript

  1. Research OS ×Paper2Agent 論文を「読む対象」から「実験できる部品」へ Paper Agent +AI CodingAgent +Experiment Harness

    による研究管理構想 検索 読解 仮説 実装 実験 証拠 Research OS Control Plane 01 Title 2026年09月21日 JAIS T 知能ロボティクス研究室 武藤 雅裕
  2. 作っている動機:研究ツールの分断を、ひとつの研究ループに変えたい 検索・読解・比較・仮説化・実験が別々の場所に分かれ、研究の文脈が失われる なぜ作るのか 論文を読んだ後、比較結果や仮説が実 験コードにつながらない。 検索 読解 比較 仮説化 実験

    Papers Review Graph Hypothesis Run 検索・メモ・実装・評価を往復するた びに、判断根拠と再現性が薄れる。 研究者が「考えること」に集中できる 共通の作業面が必要。 目指す状態 検索 → 読解 → 比較 → 仮説化 → 実験を、同じ文脈と 証拠の上で連続させる。 Source: github.com/mutomasa/research_os README / design notes 02 Research OS × Paper2Agent
  3. 作っているもの:研究活動をつなぐ TUI ベースの Research OS Paperpile・Research Agent・MCP・実験実行を、研究者の Cockpit に統合する コア構成

    文献 分析 関係 仮説 実行 Papers Review Graph Hypothesis Run Paperpile:文献 DB Claude Code:Research Agent MCP:外部サービスとの I/O TUI:研究者の Cockpit Agent 操作 Architecture: Research OS TUI → Research Agent → Skills / MCP / Subagents → Claude Code 02B Research OS × Paper2Agent 自然言語の Goal から、Agent が検索・PDF解析・比較・登 録・Graph更新までを連携する。
  4. Coding AgentとAgentic Scienceは、MCPを接点に融合している Research OSは、研究オーケストレーション層と実行層をつなぐControl Plane Researcher Research OS Research

    Workflow / State • Literature / Hypothesis / Experiment Agentic Science Layer — 研究プロセスを統括 Literature Agent Hypothesis Agent Experiment Agent Evaluation Agent AI Coding Agent Layer — 実装・Repo操作・実験実行 Claude Code Codex OpenHands Code / Experiment / Analysis Research OS = 研究能力と実行能力を、研究ライフサイクルとして統合する Control Plane 03 Research OS × Paper2Agent
  5. Research OSはPaper2Agentを 「Paper Agent生成バックエンド」として使う 1 Research OSで論文を選び Agentify 2 Agent

    RuntimeがPaper2Agentを実行 Papers / Review Claude Code / Codex PDF ✓ GitHub ✓ Code ✓ Paper2Agent Skill Review Compare Paper Agent Registry Agent Runtime VLA-JEPA 3 成果物をRegistryへ登録 READY MCP Tools Runtime Source VLA-JEPA Paper Agent CONNECTED 7 / 8 validated claude-code repo@abc1234 Paper + Repository Agentify Skill + MCP + Validation + Versionを保存 subprocess + JSON summaryで疎 結合に する Research OS内で再利用 Review Hypothesis Experiment Evidence Graph 論文の手法を 自然言語で呼び出す 既存手法との差分を 拡張案として定義 Paper Agentを Baselineに選択 論文→Tool→実験→結果の Provenanceを追跡 Research OSが State・Registry・Provenance・Experimentを管理し、Paper2Agentは生成と検証に専念する 04 Research OS × Paper2Agent
  6. Paper2Agentは、論文を「動く研究エージェント」へ変換する コードを自動検証し、MCPに整理して、対話AIから自然言語で実行できるようにする 1 プログラムを自動抽出・テスト 2 共通規格MCPに整理 Code Discovery & Validation

    3 対話AIと接続 Claude Code など MCP Tools 論文に関連するコードを取得 計算・データ処理を行う関数 専用環境を構築 Tutorialを実行 計算結果を確認 グラフ出力を確認 MCP Resources 取得 実行 MCP Paper Agent 自然言語で指示 ↓ MCP Toolを実行 ↓ 結果・グラフを返す MCP Prompts 選別 動く機能だけを安全に呼び出す 本文 ・画 像・Datasetと、 分析 の実行 手順 書を 格納 完成するPaper Agentの特性 再現可能 対話操作 研究資産を統合 手順を内蔵 検証済みコードだけを 実行対象にする 自然言語から分析・ 計算を呼び出す 本文・画像・データを 一体で参照する 複雑な分析を順番に 進められる 抽出・検証 → MCP化 → 対話AI接続により、論文の知識とコードを再利用可能なエージェントへ変換する 05 Research OS × Paper2Agent
  7. 論文の問題:読むだけでは研究が進まない Paper2Agentが見ているボトルネック 1 2 3 4 5 6 7 PDFを読む

    GitHub探す 環境構築 API理解 Notebook修正 実行 結果検証 論文・コード・データ・手順が存在しても、研究者が再利用するには 多くの暗黙知が必要。 Paper2Agentは、この摩擦を「Validated Research MCP」で下げようとしている。 Source: Miao et al., Nature 2026, Paper2Agent 06 Research OS × Paper2Agent
  8. Paper2Agentの核心:研究論文の手法を、検証済みMCPツールにする 論文だけでなく、付随するコード・tutorial・workflowを解析し、AI Agentから実行可能にする INPUT MULTI-AGENT TRANSFORMATION Paper / Repo Environment

    Agent Extraction Agent Testing Agent 依存関係と実行環境を構 築 手法・APIをMCP Toolへ 抽出 ツールを実行し挙動を検 証 論文に付随するコードベース、 tutorial、データ処理・解析 workflow OUTPUT 生成したMCPを、下流のAI Coding Agentへ接続 Validated MCP Claude Code / Codex / OpenHands 自然言語で、論文の手法を実行・再現・新しいデータへ適用 正確には、PDFそのものではなく「論文の実行知識」を検証済みMCPとしてパッケージ化する Source: jmiao24/Paper2Agent official GitHub README(2026-09-17確認) 07 Research OS × Paper2Agent Validated MCP Server Tools / Resources / Prompts
  9. なぜMCPを使うのか Agentから見た「論文の標準インターフェース」を作るため Paper MCP Resources Tools Prompts 論文本文 Supplement Dataset

    Code preprocess() analyze() visualize() train() 解析手順 再現手順 ワークフロー MCPにすると、Research OSは個別論文の実装詳細を知らずに「何ができるか」だけを呼び出せる。 Source: Model Context Protocol official docs; Paper2Agent Methods 08 Research OS × Paper2Agent
  10. Paper2AgentのAI Agentアーキテクチャ 複数の専門Agentで、論文Repoをvalidated MCPに変換する 1 2 Codebase Locator Environment Agent

    3 4 Tutorial Scanner Executor Audit 5 Tool Extractor + Test Verifier 6 MCP Server Assembly 重要:生成したtoolをそのまま信用しない。Tutorialの出力を基準に、数値・ファイル・図 を検証する。 失敗するtoolはMCPから除外 → 「LLM生成コード」ではなく「検証済みResearch Tool」へ Source: Paper2Agent Methods: six-step pipeline and test verifier-improver 09 Research OS × Paper2Agent
  11. 位置づけ:AI for Science → Agentic Science → Agent-native Science Paper2Agentは「科学成果をAgentが扱える形にする」点が特徴

    分類 意味 Paper2Agent AI for Science AIで科学研究を加速 ◎ 中心 Agentic Science Agentが研究プロセスを実行 ◎ 中心 Science for AI 科学でAIそのものを高度化 △ 主目的ではない Science of AI AIの能力・限界を科学する △ 主目的ではない Agent-native Science 科学成果自体をAgentが扱える形式にする ◎ 特徴 Research OS視点では、Paper2Agentは「Paper Runtime」として取り込むのが自然。 10 Research OS × Paper2Agent
  12. MCPの先にあるもの 論文公開の単位が “Paper + Code + Data” から “Agent Availability”

    へ拡張する 現在 次 将来 Paper Code Data Paper MCP Tools Prompts Agent Availability Agent-native Artifacts Agent Collaboration MCPはゴールではなく、科学成果をAgent社会へ接続する「公開形式」の候補。 Source: Paper2Agent Discussion: agent availability, agent-native artifacts, collaboration among paper agents 11 Research OS × Paper2Agent
  13. 類似OSS / Project:5つをピックアップ Research OSに取り込むなら「読む・作る・回す・共有する」の役割で見る 1 Paper2Agent Paper+Repo→validated MCP Agent

    基準点 / Paper Runtime 2 Paper2Code Paper→実装Repository Paper→Code部分が近い 3 AI Scientist Idea→Experiment→Paper 研究ライフサイクル全体 4 Agent Laboratory Literature→Experiment→Report Research OSに近い 5 Robin 仮説→実験→解析→次仮説 OODA型Research Loop Sources: Paper2Agent GitHub; Paper2Code/ICLR 2026; Sakana AI Scientist; Agent Laboratory/AgentRxiv; FutureHouse Robin 12 Research OS × Paper2Agent
  14. 知識科学の研究者向け:Research OS 利用ガイド 問いを起点に、根拠付きの知識構造を作り、仮説と実験へつなげる 1|研究の問いを定義 4|知識構造を比較する 対象概念・関係・期間と、何を説明したいかを Goal に入力 Graph:概念・理論・研究者・データの関係、対立、変化を可視化

    2|文献と証拠を集める 5|Research Gapを仮説化 Papers:Paperpile / OpenAlex から文献を検索・登録 Hypothesis:不足する関係から RQ・仮説・評価基準を作成 3|主張を根拠付きで抽出 6|実験し、知識を更新 Review:概念定義・方法・結果・限界を引用箇所とセットで残す Run:MCP / Claude Codeで検証し、結果と反証をGraphへ戻す 最初は10〜20本の文献で開始。Agentの出力は、引用元・関係・判断理由を研究者が確認して確定する。 13 Research OS × Paper2Agent
  15. Research OSへの取り込み方 Paper2AgentをResearch OSの “Paper Runtime” として位置づける Research OS Core

    Paper Runtime Experiment Runtime RQ / Hypothesis Experiment DB Evidence Graph TUI State Paper2Agent Paper MCP PaperQA Metadata Claude Code Docker / uv MLflow Slurm / Ray Research OSは「何を検証するか」を管理し、Paper MCPとExperiment Harnessが「どう実行するか」を担う。 14 Research OS × Paper2Agent
  16. Experiment Harness:研究で一番重要な層 AI Coding Agentの出力を、再現可能な実験へ固定する Code Data Config commit /

    diff version / checksum seed / hyperparams Env Metric Evidence Docker / CUDA baseline comparison claim / result / trace Harnessがないと、AI Agentは速くコードを書くが、研究としての証拠が残らない。 Research OSでは、experiment.yaml / result.json / evidence.md を標準成果物にする。 15 Research OS × Paper2Agent
  17. MVPロードマップ まずは「論文登録 → 実験仕様 → 実行 → 証拠化」の最小ループを作る v0.1 v0.2

    v0.3 v0.4 v0.5 Paper / Hypothesis / ExperimentをMarkdownで 管理 PaperQA + Paper metadata + citation graph Paper2Agent的にPaper MCPを生成・登録 Experiment Harnessで run/evaluateを固定 Evidence Graphからnext experimentを提案 最初に作るべきコマンド research paper add / research hypothesis create / research experiment run / research evidence show 16 Research OS × Paper2Agent
  18. 結論:研究者は何を使って研究すればよいか Research OSは、Agentic ScienceのControl Planeになれる 読む 作る 実行する 残す PaperQA

    Semantic Scholar / OpenAlex Zotero / Paperpile Claude Code / Codex Paper2Code GitHub Paper2Agent MCP Docker / uv Slurm / Ray / MLflow Neo4j / Graphiti Experiment Manifest Evidence Graph Research OSの価値は、AI Agentを束ねることではなく、研究の問い・実験・証拠・次 の判断をつなぐこと。 Paper2Agentは、その中で「論文を実行可能な研究部品に変換する」中核レイヤになる。 17 Conclusion
  19. 参考資料 本文中で扱った主要ソース • Miao et al. “Reimagining research papers as

    interactive and reliable AI agents.” Nature, 2026. • mutomasa/research_os README: Research OS TUI, Research Agent, MCP, Claude Code構想。 • Model Context Protocol official docs: Resources / Tools / Prompts. • Paper2Code / PaperCoder: paper-to-code generation trend. • Sakana AI Scientist: Idea→Experiment→Paperの自動化。 • Agent Laboratory / AgentRxiv: autonomous research workflow and shared agent research. • FutureHouse Robin: multi-agent system for automating scientific discovery. • PaperQA, ScienceAgentBench, PaperBench: scientific RAG and evaluation trends. 18 Sources