VCやCVCの調査担当者が新たな投資先を探す際、無数にあるスタートアップの中からどのように面談候補を絞り込むかが最初の課題となります。この記事では、公開情報を活用して、面談やデータルームで確認すべき会社を整理したロングリストと、面談で確認すべき質問リストを作成する手順を解説します。
未上場企業の売上・資金残高・評価額などは公開されていない場合があります。そこで、自社の投資仮説に合う法人を同定し、確認できた事実と面談で聞く項目を分けてロングリストへ記録します。対象業界、投資ステージ、地域、除外条件を先に定めれば、面談する順番も決められます。
これから紹介する5つのステップを通じて、公開情報から効率的かつ客観的に面談候補をリストアップし、実際のデューデリジェンスに向けた土台作りを進めてください。
公開情報で作れるのは投資推奨ではなく調査ロングリスト

ベンチャーキャピタルやCVCの調査担当者が直面する課題のひとつに、膨大なスタートアップ企業から自社の投資戦略に合致する候補を見つけ出すソーシング業務があります。初期段階では公開情報を頼りに候補を洗い出すが、情報が散在しており作業が属人的になりがちです。
本記事では、J-Startup、gBizINFO、EDINETなどの公開情報を組み合わせ、面談候補となる法人を同定してロングリストを作成する手順を解説します。
ロングリストには対象業界と投資ステージを記録します。想定投資額、地域、自社の既存投資先との競合も列を分けます。各社を同じ条件で見比べ、面談候補へ進める理由を残します。この段階の順位は面談の優先順です。投資の可否は面談と非公開資料の確認後に判断します。
未上場スタートアップの調査において最も注意を払うべき点は、未公表情報の取り扱いです。上場企業なら定期的に開示する売上高や利益、現預金などの資金残高も、未上場企業では公開されないことが一般的です。特定顧客への依存度・詳細な株主構成・最新ラウンドの企業評価額も同様です。
ロングリスト作成時において、これらの公開されていない数値を、断片的なニュース記事の表現や類似企業の業績推移から安易に補間・推定することは避けなければなりません。推測に基づくデータが確定した事実としてリストに混入すると、後続の投資検討プロセスで重大な判断の誤りを引き起こす原因となります。
公開情報を扱う性質上、情報の時間軸の管理も極めて重要です。スタートアップの事業進捗や資金調達の状況、公的機関による認定状況は短期間で変化する可能性があります。そのため、リストには必ず各データを閲覧・取得した確認日を記録します。
公式サイトの記載事項や外部データベースの照会結果を、いつ時点の事実として認識したかを明記することで、過去の情報を現在の状態として固定化してしまうリスクを防げます。確認日を保持することは、定点観測としてリストを更新し、差分を把握する際にも必須の要件となります。
調査ロングリストでは、客観的に確認できた事実と、面談で聞く項目を別の列に仕分けます。
リスト上に残された欠測項目や未公表情報こそが、次のステップである起業家との面談や、データルームを通じたデューデリジェンスにおいて直接確認すべき事項となります。公開情報から構築するリストは、投資判断を下すためではなく、面談に向かうべき企業を絞り込み、限られた時間のなかで何を質問すべきかを定義するための堅牢な実務の土台として機能します。
J-Startup選定企業を候補母集団の入口にする

未上場企業を網羅的に調べることは困難であるため、ロングリスト作成の第一歩として、政府や自治体による支援プログラムの選定企業群を活用することが有効です。その代表的な入口の一つが、経済産業省が推進するJ-Startupプログラムです。
経済産業省のスタートアップ・新規事業ページでは、J-Startupを、革新的な技術やビジネスモデルで世界に新しい価値を提供するスタートアップを選定・育成する官民連携プログラムとして説明しています。
この制度目的は、新しい企業を国を挙げて支援し、イノベーションを促進することにあります。こうした政策的な方向性に合致した企業群がJ-Startup公式サイトに掲載されています。
ここで調査担当者が注意すべき点は、プログラムへの選定は政策目的のもとに選ばれた支援対象であることを示すにとどまり、VCやCVCに対する投資の適格認定ではないということです。J-Startupに選ばれているという事実は、将来的な投資収益、現在の財務健全性、あるいは自社のファンドからの株式取得可能性を保証するものではありません。
調査ロングリストを作成する際には、J-Startup選定という項目を客観的な事実列としてそのまま記録します。国に選ばれたという事実を、独自の解釈で投資適格や成長確実といった主観的な評価へ変換してはいけません。
また、企業の状況は時間とともに変化するため、選定日の記録が不可欠です。いつの時点でプログラムの要件を満たしていたかという時間軸の情報がなければ、現在の事業状態を正しく測ることはできません。J-Startup公式サイトには選定企業の情報だけでなく、プログラムの見直し情報も掲載されます。
企業が成長して上場したり、事業の方向転換によってプログラムの対象外となる場合があるためです。したがって、過去に掲載されていた企業を現在も選定状態にあるものとして固定してはいけません。選定時期と見直し日の両方をリストに保存し、現在の正確なステータスを管理します。
候補発見の入口となる採択、認定、表彰の制度は、各省庁や自治体にも多数存在します。これらもロングリストの母集団形成に役立ちますが、制度ごとに目的、対象、審査基準が異なる点に留意が必要です。特定の技術分野の振興を目的とするものや、地域活性化を目的とするものなど、政策的な意図は様々です。
そのため、複数の制度に採択されていることを単純な点数へと変換し、合算して企業を比較することは適切ではありません。
ロングリスト上でこれらの情報を管理する際は、それぞれの制度への選定を独立した要素として扱います。制度名、選定主体、選定日、制度目的、公式URLをそれぞれ独立した列として記録します。事実を細分化して台帳化しておくことで、企業が過去にどのような基準で評価されてきたのかを正確に振り返ることができ、自社の投資仮説との合致を客観的に検証する土台が整います。
gBizINFOで法人番号と公開情報を照合する

スタートアップの調査において、企業名の表記揺れや社名変更、同名他社との混同を防ぐためには、統一されたキーで情報を管理する必要があります。この名寄せ作業の要となるのが、経済産業省が運用するgBizINFOと法人番号の活用です。
gBizINFOは、法人番号を軸に企業の基本情報を提供するプラットフォームです。各省庁などが保有する届出・認定・表彰・財務・特許・調達・補助金・職場情報なども集約しています。
システム連携による調査の効率化を目的とする場合、Gビズインフォ APIの利用のページから手続きを行うことでAPIを利用できます。
現在提供されているREST APIはAPI v2であり、利用にあたっては事前の申請と、その後に表示されるAPIトークンが必要となります。
詳しい実装方法についてはREST API利用マニュアルやAPI・ダウンロード機能FAQを参照し、gBizINFO REST APIポリシーに従ってデータを取得します。
また必要に応じてgBizINFO SPARQL API仕様などの関連文書も確認してください。
ロングリストを作成する第一歩として、候補となる企業の法人番号を特定し、データベースの主キーとして設定します。これにより、別法人を誤って同一企業として結合するリスクを減らすことができます。ただし、システムによる機械的な検索結果のみに依存するのは不十分です。
必ず対象企業の公式ウェブサイトに掲載されている会社概要と、取得した法人番号を人が目視で照合し、正しい法人であることを確認する手順を組み込みます。
情報を取得した際は、値だけでなく法人番号・法人名・所在地も保存します。gBizINFO上の更新日と、自社がデータを取得した日もセットにします。各項目の原典もあわせて記録しておくことが重要です。官公庁のデータや企業の状況は日々更新されるため、いつ時点のどのような情報を根拠にリストを作成したかを明確にする必要があります。
また、APIの仕様や提供条件が将来変更される可能性も考慮し、利用したAPIのバージョンも忘れずに記録しておきます。
公開情報を用いた調査で特に注意すべきなのが、データが存在しない状態、すなわち欠測の扱いです。gBizINFOのAPIを使用して特定の項目の値が空であったとしても、それを事業実績なしと断定してはいけません。
スタートアップの性質上、情報がまだシステムに連携されていない、そもそも提供対象外の領域である、あるいは戦略的に非公表としているなど、欠測の理由は複数存在します。公開されていない売上高や利益、評価額、株主構成などの数値を、この欠測状態や類似企業のニュースから補間して推定することは避けてください。
また、逆に補助金や政府調達の掲載がgBizINFO上で確認できたとしても、それは過去の特定の時点における事実を示すものに過ぎません。その情報をもって当該企業の売上が持続的に成長していることや、顧客の継続率が高いことを証明するものではなく、投資適格であるという推奨を意味するものでもありません。
法人番号で同一企業を確認し、欠測項目を面談質問へ移すことで、候補ごとの次の調査を決められます。
EDINETで提出者・書類種別・訂正を確認する

スタートアップの調査リストを構築する際、金融商品取引法に基づく開示書類が閲覧できるEDINETを活用することで、法定開示の範囲における確かな事実を整理できます。ただし、利用にあたっては前提となる制度の理解と、適切なデータ取得の手順を踏む必要があります。
まず、未上場のスタートアップすべてに有価証券報告書などの提出義務があるわけではない点に留意します。提出義務は企業と募集・開示の状況によって異なります。
したがって、EDINET上で対象企業の検索結果が一件もなかったとしても、それを売上がゼロである、資金調達をしていない、あるいは法令違反をしているといった否定的な状態として解釈してはいけません。公開情報が存在しないという状態をそのまま欠測としてリストに記録することが重要です。
情報をプログラムから効率的に取得するためには、公式に提供されているEDINET API Version 2を利用します。APIの利用には事前にユーザー登録を行い、専用のAPIキーを発行する必要があります。
EDINET API利用案内やEDINET操作ガイド・API関連資料などの公式ドキュメントを参照し、仕様に沿った実装を行います。
EDINETの書類一覧は原則として1分ごとに更新されるが、過剰なアクセスによってシステムへ負荷をかけないよう、公式のガイドラインを遵守します。
EDINETから取得する情報は、書類種別と提出者を正確に区別して整理します。書類種別には、有価証券報告書、臨時報告書、大量保有報告書などがあります。調査候補のスタートアップ自身に提出義務がなくても、その企業に出資している上場企業の有価証券報告書や臨時報告書などに、対象スタートアップへの出資額や取引関係が記載されている場合があります。
このとき、書類の提出者と記載対象の会社を混同すると、誤った財務状況をリストに紐付けてしまいます。誰が誰について報告している書類なのかを台帳上で明確に分けます。
さらに、開示書類の内容は一度提出された後から変更される可能性があるため、訂正・取下げの履歴管理が欠かせありません。API経由で情報を取得する際は、書類管理番号・提出者・提出日・書類種別コード・対象期間を保存します。訂正や取下げの有無と取得日時も同じ記録に残します。
もし訂正報告書が提出されている場合は、元となる書類との関係性を確認したうえで、古い数値を単純に消去して上書きするのではなく、いつの時点でどのような変更が行われたのかを変更履歴として残します。
EDINETで書類が見つかった企業は、提出者と対象者の関係、訂正履歴をロングリストに記録します。書類が見つからない企業は面談時の確認項目を残し、他の候補と同じ条件で調査を続けます。
AIを使って投資仮説から面談質問まで5ステップで進める
公開情報を用いてスタートアップ調査のロングリストを作成し、面談への準備を整えるための手順を5つのステップで説明します。このプロセスの目的は、AIに投資委員会の判断を完結させることではなく、次に直接確認すべき事項を整理して面談質問を作ることです。手作業では複数のウェブサイトを巡回して情報を転記します。
AIを使う場合は、保存した公開資料から引用付きの候補表を作らせ、担当者が原文との照合に時間を使えます。
ステップ1は投資仮説の定義です。誰のどの課題に対して、どのような技術や流通優位で応える会社を探すのかを一文で明確にします。この仮説が、以降の調査対象を絞り込むための基準となります。対象とする業界、地域、投資ステージなども併せて設定します。この段階で設定した仮説や条件は、単なるメモではなく、テキストファイルとして保存しておきます。
たとえば、investment_thesis.mdというファイル名で保存し、箇条書きで明確に要件を記述しておくと、後でAIに読み込ませる際の判断基準として正確に機能します。
ステップ2では、J-Startupなどの公式リストから候補となる母集団を作ります。このとき、単に企業名をリストアップするだけでなく、それぞれの選定日やその制度の目的も必ず記録に残します。収集したデータは、company_sources.csvといった表計算ファイルにまとめます。
1行を1レコードとし、企業名、選定リスト名、選定日といった列名を明確に定義しておくことが、後続のAIによるデータ処理を正しく行わせるための前提となります。
ステップ3では、抽出した企業の法人番号を特定し、データの土台を固めます。gBizINFOで取得できる法人番号を識別子として使い、企業公式サイトの会社概要とこの登録情報を照合します。また、EDINETから提出者や書類種別、訂正の有無といったデータを取得して保存しておきます。
同名企業や表記揺れによる重複を排除し、検索結果から別法人を誤って結合してしまうリスクを防ぐため、データの土台作りにおいては人が目視で確認し、正しい法人番号を割り当てる作業が欠かせません。
ステップ4は根拠台帳の作成と、AIを用いた情報整理の実行です。通常の手作業では、企業の公式発表、取得済みの特許や認定、該当する法定開示書類などを発表単位で記録し台帳化します。数字を扱う場合は、通貨、対象期間、完了した実績か今後の予定かを明記し、必ず原文のURLを紐付けます。この情報整理にAIを利用することで、手作業の負担を減らすことができます。
具体的な操作として、ChatGPTの画面を開きます。入力欄の添付機能を利用して、事前に作成したinvestment_thesis.md、company_sources.csv、そしてgBizINFOやEDINETの保存データ(CSVやJSONファイルなど)をアップロードします。
このとき、入力するデータは公開情報だけに限定し、データルームの資料やNDA(秘密保持契約)を結んで得た非公開資料は決して送らないという明確な境界線を設けます。
また、業務利用にあたっては、OpenAIのビジネスデータに関する方針などを確認し、利用するプランにおいて入力と出力が既定でモデル学習に使われない設定になっているか、自組織の管理者に確認しておく必要があります。
組織で承認された環境であれば、ClaudeやGeminiなど、ファイルのアップロードと分析が可能な他のAIサービスでも同様の入出力契約に基づいて実務を進めることができます。
ファイルをアップロードした後、ChatGPTのデータ分析機能を使ってPythonによる処理やCSV出力を行わせるため、以下のような依頼文を送信します。読者がそのままコピーして実務に使える形式です。
アップロードしたファイルを用いて、スタートアップ調査の情報を整理してください。以下の条件を厳格に守ってデータ処理とCSV出力を行ってください。
1. 出力ファイル要件
以下の3つのCSVファイルを出力してください。
・startup_longlist_candidate.csv(投資仮説に基づくロングリスト候補)
・verification_queue.csv(人が確認すべき重複・別法人候補や不明点のリスト)
・interview_questions.csv(仮説検証と情報不足を補うための面談用質問リスト)
2. データ処理のルール
・すべてのデータは「法人番号」を主キーとして結合・整理してください。
・投資仮説(investment_thesis.md)との一致度を評価する際は、情報を「確認できた証拠(事実)」「投資仮説に反する要素(反証)」「情報がない項目(欠測)」に明確に分けて整理してください。
・未公表の数値を公開情報から推定しないでください。
・出力するすべての行に、情報の出所を示す「source_url」、原文の該当箇所を抜粋した「source_quote」、および情報を確認した日付「observed_at」を付与してください。
この依頼により、AIは企業の有望度を直接採点するのではなく、事実の抽出と情報の状態整理に徹します。ただし、AIが出力した結果はあくまで候補です。生成された表をダウンロードし、法人番号・選定状態・発表日を人が原文と照合します。資金調達の完了状態や、EDINETの提出者と対象も確認します。
とくに、資金調達が完了した実績なのか今後の予定なのかの区別や、提出者と対象法人の突合は、AIが文脈を取り違える可能性があるため、必ず原典のURLにアクセスして事実確認を行います。人の確認を経て初めて、更新元となる手元の表へ反映させます。
ステップ5では、投資仮説との一致度と情報の欠測状況から面談の順序を決定します。調査過程で候補を除外する場合は、除外理由を保存します。対象外の業種、地域外、ステージの不一致、同一法人の重複といった理由のほかに、情報不足というカテゴリを設けます。
情報不足は事業性の否定ではないため、公開情報の少ない企業を自動的に低評価にせず、確認コストと重要度に応じて質問を組み立てます。出力されたinterview_questions.csvを活用し、足りない情報をどのように聞き出すかを整理します。情報を更新する際は新しい公式発表を追加し、過去の記録は上書きせずに履歴として残します。
実際の面談では、売上構成・顧客の継続状況・粗利・資金残高・株主構成を直接確認します。知財の帰属・規制・訴訟・情報セキュリティなども確認対象です。ロングリストに残した未確認項目を質問へ変え、次のデューデリジェンスで集める資料を決めます。
これにより、面談の場では公開情報で分かることの再確認を省き、真に確かめるべき非公開情報のヒアリングに集中できます。
よくある質問
J-Startupに選定されている企業は投資適格とみなしてよいですか
J-Startup公式サイトに掲載されている企業は、革新的な技術等で新しい価値を提供するとして官民連携の育成プログラムに選定された企業を示す事実であり、国が投資収益や財務健全性を推奨する適格認定ではありません。
あくまで調査対象の母集団を作る一つの入口として活用し、実際の事業評価や投資可否は、各VCやCVCの投資仮説に基づく一次情報の取得や面談を通じて個別に判断してください。
EDINETで検索して開示書類がない企業はリストから除外すべきですか
除外する必要はありません。未上場スタートアップには、EDINETへ有価証券報告書等を提出していない企業もあります。検索して該当する開示書類がないことを、売上がない、あるいは法令違反であると解釈するのは誤りです。情報が存在しない項目は欠測として扱い、面談時に経営陣へ直接質問すべき確認項目としてリストに記録しておいてください。
ニュースにも出ていない未公表の企業評価額や売上はどのように推定すべきですか
公開情報によるロングリスト作成の段階では、未公表の数字を類似企業や過去の傾向から推定・補間することは避けてください。評価額・売上・利益・資金残高・株主構成などは、外部から正確に推し量ることが困難です。推測値で有望度を順位付けするのではなく、リストには未確認項目として明記し、面談やデータルームの過程で一次資料に基づいて事実を確認する手順を取ります。
作成したロングリストの情報はどのように更新していくのがよいですか
新たな公式発表や資金調達のニュース、EDINETの訂正報告書などが確認できた際は、過去の記録を上書き消去せず、履歴として追記して管理します。
J-Startupの見直し情報や、Gビズインフォ APIの利用を通じて得た最新の更新データも同様に扱います。情報の確認日や取得日時を必ず併記し、過去の事実関係がどう推移したかを追跡できるように根拠台帳を維持してください。
調査手法について
こちらの記事はグラフAIリサーチプラットフォームのSnorbeを使って作られています。Snorbeは研究開発・新規事業向けの調査テーマに応じた幅広い項目のオートリサーチや、ナレッジグラフの構築、構造化レポートの生成ができるAIリサーチツールです。

Screenshot
調査したいテーマを入力するだけで、AIが深堀りすべき観点や広げるべき調査項目をレコメンドしながら、自動でリサーチを進めます。収集した情報はナレッジグラフとして蓄積され、未調査領域(ホワイトスペース)を可視化しながら調査の網羅性を高めていけます。
また、観点マトリクスを30秒・構造化レポートを10分で自動生成する機能があり、出典付きのレポートをMarkdown/PDF形式でエクスポートできます。調査の元データも保存されるため、ファクトチェックや社内共有も容易です。
ご利用をご希望の方は、こちらよりお申し込みください。
また、グラフAIを活用した社内ナレッジ管理や、研究開発・新規事業のリサーチ支援、セルフホスト導入のご相談も受け付けています。お困りの方はお気軽にご連絡ください。
市場調査やデスクリサーチの生成AIエージェントを作っています 仲間探し中 / Founder of AI Desk Research Agent @deskrex , https://deskrex.ai


コメント