自社で扱っている素材の効果を調べたところ、「効果が示された」研究と、「明確な効果が示されなかった」研究が見つかった。
こうした場面はめずらしくありません。多くの場合、ポジティブな結果だけを使いたくなるでしょう。効果がなかった研究を営業資料に載せるメリットがないからです。
しかし、これは正しい結果といえるのでしょうか?本当は正しいとは言い切れないけど、悪い結果に目をつぶっていませんか?
論文によって結果が違うとき、何を信じればよいのか。
この問いに方法論として向き合ってきたのが、システマティックレビュー(SR)という考え方です。
システマティックレビューが何か、なぜ信頼性が高いと言われ、扱う際の注意点は何か、そして企業の商品やサービスにどう活かせるのかを順に説明します。
システマティックレビューとは?
医学分野の国際的な組織であるコクラン(Cochrane)は、システマティックレビューを「特定の研究疑問に答えるために、あらかじめ規定した選択基準に合致する経験的エビデンスをすべて集めようと試みる」ものと定義しています。
少し難しいですね・・。押さえておきたいのは3点です。
- 問いがひとつに絞られていること
- ルールが決まっていること
- 結論だけでなく、その確からしさまで示されること
我々がシステマティックレビューを作成する場合、まずテーマを共有し、基準に照らし合わせ、正確性を担保するようにしており、コクランの考えに則っています。
論文数に関する条件はないことに注意です。
論文を100本読んでも探し方と選び方にルールがなければ、システマティックレビューとは呼びません。逆に、対象となる研究が5本しかなくても、手順が守られていればシステマティックレビューと言えます。
文献数については検索ルールに従った結果いくつになるか、という結果論的なお話であることに注意しましょう。
普通の文献調査と、何が違うのか
通常の文献調査と異なる点を比較していきます。
大きな違いは「探す前にルールを決めているか」という点です。これは出発点になるので明確化しておきたいです。
普通の文献調査では、調べながら方針が変わります。良さそうな研究が見つかれば深掘りし、思うような結果が出ないテーマは扱いが小さくなる。
都合のいいところだけを解釈してしまう・・よくバイアスなどと言ったりしますね。
システマティックレビューはこのバイアスを構造的に禁じてしまいます。検索を始める前に、問い、探す場所、採用と除外の条件を文書等で固定するのです。
システマティックレビューを多用する医学分野では、着手前に国際的な登録簿へ計画を公開する慣行もあるぐらいです。
調査方式の比較
一般的な文献調査とシステマティックレビューの比較を行いましたが、実際はGoogle検索から入ることも多いと思います。
ここではこの3つの調査方式の比較を行います。
| Google検索 | 一般的な文献調査 | システマティックレビュー | |
|---|---|---|---|
| 探し方 | 思いついたキーワードで検索 | 主要なデータベースを必要に応じて | 検索式と対象を事前に確定し、複数を横断 |
| 選び方 | 上位に出たもの、読みやすいもの | 調査者の判断 | 事前に決めた基準で、2名以上が独立して |
| 網羅性 | 低い | 調査者の知識と時間しだい | 網羅を目指す(未公表研究や他言語も含める) |
| 質の評価 | しない | する場合としない場合がある | 必ず行う |
| 透明性・再現性 | 低い | 記述次第 | 検索式や除外理由まで公開する |
| 向いている場面 | 素早く全体像をつかむ | 専門家が仮説を立てる | 意思決定の根拠を示す |
Google検索は素早く方向性を示せる一方で頼り切るには不十分。
システマティックレビューは反論も含めて網羅的に抽出して一つの結論を見出すので、かなり頼れる説得材料になります。
つまり手法自体の優劣を示すものではなく、時と場合によって適用すべき手法が異なるということになります。
システマティックレビュー手法の応用
システマティックレビューは研究や機能性食品などにおいて使われてきた手法ですが、eSTEM PLUSでは非科学領域のビジネスへの転用まで幅広く支援しています。これはおそらく国内初のサービスです。
※なお、他例がないことを証明するのは「悪魔の証明」と言われ非常に難しいため、あくまで「おそらく」であることをご理解ください。
営業資料で「こんな効果が証明されています!」「ここがすごいんです!」と、ポジティブなことばかり言われると誠実さに欠けるなと思ったことはありませんか?
システマティックレビューではネガティブな結果も含めて一つの答えを出すため、顧客に対して強い信頼性を示すことができます。
システマティックレビューの進め方
システマティックレビューを作成する方法としては、次の7つのステップに分かれます。
共通しているのは、どのステップもあとから都合よく変えられないように設計されている点です。これが信頼性につながります。
1. 調べたい問いを決める
例えば、「この素材は体にいいか」では漠然としすぎています。誰に、何を、何と比べて、どうなるのかまで絞り込みます。
2. 検索方法を決める
どのデータベースを、どんな検索式で、いつからいつまで探すか。採用と除外の条件も、ここで文書にします。
後から決めると都合のいいように解釈するバイアスがかかるので、非常に大事なポイントです。
3. 関連研究を探す
ひとつのデータベースでは足りません。コクランは「MEDLINE単独の検索は十分とは見なされない」と明記し、最低でも3つのデータベースを引用することを求めています。進行中の研究が登録される試験登録簿や、報告書・学位論文といった公表されにくい資料まで探し、言語による絞り込みもかけません。
4. 基準に従って研究を選ぶ
集まった文献を、2で決めた検索方法に照らして選別します。2名以上が独立して行い、判断が割れたら話し合うことが推奨されます。
5. 研究の質やバイアスを評価する
採用した研究を、すべて同じ重みでは扱いません。研究の「作り方」に起因する系統的な歪みを、領域ごとに評価します。例えばランダム化比較試験なら、割り付けの方法、介入のずれ、データの欠測、測定のしかた、報告結果の選択という5つで行います。
6. 結果を整理する
各研究から、対象者、条件、測定方法、結果、資金源などを、決めた項目に沿って取り出します。ここも2名以上で行うのが標準です。
7. 全体として何が言えるか判断する
何が分かっていて、何が分かっていないかを示し、結論に「どれくらい確からしいか」の格付けを添えます。
なぜ信頼性が高いと言われるのか
システマティックレビューはかなり信頼性の高い文献として認識されています。
この理由は「権威ある機関が作っているから」ではなく、その手順に理由があります。
都合の良い論文だけを拾いにくい
結果を見てから基準を変えればどんな結論でも作れてしまいます。
基準を先に固定することで都合の良さを排除します。
見つけやすい研究だけに偏らない
ひとつの情報源で済ませると「見つけやすさ」で研究が選ばれます。
複数のデータベースや未公表研究まで探すのは、偏りを減らすためです。
ひとりで判断しない
2名以上が独立して選び、抽出することで、思い込みや見落としが結論に入り込む確率が下がります。
研究の質まで見る
その研究がどう設計され、どう実施されたかを評価します。
掲載誌の格(インパクトファクター)や著者の肩書きでは見ません。
調査方法を全部書く
いつ、どこを、どんな検索式で探し、何をなぜ除外したか。報告のルールはPRISMAという国際的なガイドラインになっており、「完全な報告は、読者が方法の妥当性を評価し、ひいては知見が信頼できるかどうかを判断することを可能にする」と説明されています。
つまり、「正しい結論を保証」するというわけではなく、「読者側が安心できるよう文書上でアピールする。」ということです。
メタアナリシスとの違い
システマティックレビューについて十分理解できたところで、メタアナリシスにも触れておきましょう。
システマティックレビューとメタアナリシスの2つは混同されやすいのですが、別のものです。
| システマティックレビュー | メタアナリシス | |
|---|---|---|
| 何をするものか | 集めて、選んで、評価して、まとめる手順の全体 | 2つ以上の研究の結果を統計的に結合する手法のこと |
| 性質 | 調査の方法論 | 統計の手法 |
コクランはメタアナリシスを「2つ以上の別々の研究の結果を統計的に結合すること」と定義し、あわせて「システマティックレビューは、メタアナリシスを1つも含む必要はない」とも明記しています。
書いていて思ったのですが、毎度コクランは少しわかりづらい言葉を使いますね・・。
分かりやすく言うと、「システマティックレビューの手順の中にメタアナリシスというプロセスがある」ということです。
ちなみにメタアナリシスは手順の一つなので、必ずシステマティックレビューには使わなければならないというわけではないです。
なぜ、使わないことがあるのか。
メタアナリシスは統計手法です。データを統合するために異なる文献間で平均を取ったりします。しかし、研究の条件がばらばらだと、平均値に意味がなくなります。
例えば同じ人を測った10台の体重計の平均には意味がありますが、特性の異なる人の体重結果を混ぜて平均しても大きなノイズになり意味がありません。
コクランも、結果のばらつきが大きく、とくに効果の方向が食い違っている場合、平均値を示すことは誤解を招きうるとしています。
ここからエビデンスを示す際には、統合された数字だけを資料に引用することはリスクが高いということが言えます。
その裏にどんな条件の研究が何本あり、質はどうだったのか。そこを確認せずに数字だけを持ち出すと、根拠として最も脆い部分を示すことになりかねません。
システマティックレビューの質を下げる要因
システマティックレビューは、質の低い研究を集めても、質の高い結論にはなりません。
私はお客様によく「小学校の勉強だけをどれだけ高度にやっても大学受験レベルの学力は付かない」という例え話を使っています。当然、大学受験には高校レベルの知識を組み合わせて挑む必要がありますからね。
エビデンスの確実性を評価する国際的な枠組みであるGRADEアプローチでは、ランダム化比較試験の集まりは「高い確実性」から出発しますが、そこから減点していきます。減点が重なれば、低い評価になっていきます。
確実性を下げる要因は以下の5つです。少し発展的な話なので、「確実性を下げる要因がいくつかあるんだなぁ」ぐらいにとどめて読み飛ばしても問題ありません。
- バイアスのリスク(Risk of Bias): 研究の実施方法に不備(盲検化の不完全さ、脱落率の高さなど)がある。
- 非一貫性(Inconsistency): 複数の研究間で、結果(効果の大きさや方向性)にバラつきが大きく説明がつかない。
- 非直接性(Indirectness): 研究の対象者、介入、対照、アウトカム(PICO)が、実際の臨床疑問とズレている(例:若者だけのデータから高齢者へ一般化する、代理アウトカムを使っているなど)。
- 不正確さ(Imprecision): サンプルサイズが小さい、または信頼区間(CI)が広すぎて、効果があるのかないのか判断しにくい。
- 出版バイアス(Publication Bias): 治療に否定的な研究結果が公表されていない疑いが強い。
レビュー自体の質にも、ばらつきがあります。 生物医学分野のシステマティックレビュー300件を無作為に抽出した調査では、公表されていないデータの情報源まで探していたのは7%、計画を事前に登録していたのは4%でした。別の調査では、100件のうち検索の手順を完全に再現できたのは1件だけです。
こうした背景から、2016年には、エビデンスの信頼性を三角形で表し頂点にシステマティックレビューを置く従来の図について、見直しが提案されました。
代わりに提案されたのが、それぞれの手法の境界線を曖昧にしたり、システマティックレビューを他の研究を見るための道具として位置づけ直すことでした。

都合の良い結果は表に出てきやすい(出版バイアスの罠)
都合の悪い結果は、そもそも表に出にくいです。
ある薬剤について、規制当局(規制や認可を行う公的機関)に登録されていた74件の臨床試験を調べた研究があります。当局の判定で陽性と評価されたのは51%でした。ところが公表された論文だけを見ると、94%が陽性だったのです。
陰性と判定された試験の多くは公表されず、一部はポジティブな結果として公表されていました。効果の大きさも、全体で32%大きく見えていました。
各論文の著者が嘘をついているわけではなく、ポジティブな結果が評価されやすいのが論文です。よって、都合の悪いネガティブな結果はあまり出回りません。これが出版バイアスと呼ばれる現象です。
もう一度やっても、同じ結果が出るとは限りません。 2015年、心理学の100件の研究について、再現実験を行った大規模なプロジェクトがありました。元の研究では97%が統計的に有意だったところ、再現実験で有意だったのは36%。効果の大きさも、およそ半分でした。
そのうえ、論文の数は増え続けています。システマティックレビューだけでも、2019年には1日あたり約80件が公表されている計算だそうです。ある主張を支持する研究を1本見つけることは、多くのテーマで可能です。
重要なのは、「この主張を支持する論文を見つける」ではなく、「この主張について、研究全体はどちらを向いていて、どれくらい確からしいかを評価する」です。
仮に前者のような1本の論文を根拠にした訴求は、反対の結果を示す研究を持ち出された瞬間に信頼性が泡となって消えます。
あとになって、「弊社の商品はこの論文とはこういう箇所が異なっているので」などと弁明しても、嘘をついたという扱いになります。あと、普通に再現性が取れていなくて弁明すらできないかもしれません。
研究全体を把握したうえで「ここまでは言える、ここからは言えない」と整理してあれば、想定外の指摘を受けにくくなります。
まとめ
冒頭の問いに戻ります。「効果が示された」研究と、「明確な効果が示されなかった」研究、どちらを信じればよいのか。
答えは、どちらでもありません。
それぞれの研究の主張を見て、何がどこまで言えるのかを整理することが、システマティックレビューという方法論が示している答えです。
- 論文を探す前にルールを決める
- メタアナリシスは必須ではなく、まとめないという判断も方法論のうち
- システマティックレビューであっても万能ではなく、元の研究の質に左右される
- 「論文が1本ある」ではなく「研究全体がそう言える」の方が信頼しやすい
この考え方は、最良のエビデンスとして研究で使用するほか、経営の意思決定の透明化など、幅広く活用することが可能です。
関連研究をまとめて調べたい。営業資料の科学的根拠を強化したい。自社商品の根拠を整理したい。新規事業の技術的な妥当性を確認したい。
eSTEM PLUSでは、こうしたご相談を承っています。まずは「何が言えて、何が言えないのか」を切り分けるところからお手伝いします。お気軽にお問い合わせください。
参考情報・参考文献
方法論の定義・手順について
- Cochrane Handbook for Systematic Reviews of Interventions, Chapter 1: Starting a review システマティックレビューの定義、「その場しのぎの検索と研究選択」の問題、研究疑問の設定の重要性 https://www.cochrane.org/authors/handbooks-and-manuals/handbook/current/chapter-01
- Cochrane Handbook, Chapter 4: Searching for and selecting studies 「MEDLINE単独の検索は十分とは見なされない」、複数データベース・試験登録簿・灰色文献の検索、言語制限をかけないこと https://www.cochrane.org/authors/handbooks-and-manuals/handbook/current/chapter-04
- Cochrane Handbook, Chapter 8: Assessing risk of bias in a randomized trial バイアス評価の5つの領域 https://www.cochrane.org/authors/handbooks-and-manuals/handbook/current/chapter-08
- Cochrane Handbook, Chapter 10: Analysing data and undertaking meta-analyses メタアナリシスの定義、「システマティックレビューはメタアナリシスを1つも含む必要はない」、条件がばらつく場合に平均値が誤解を招くこと https://www.cochrane.org/authors/handbooks-and-manuals/handbook/current/chapter-10
- Cochrane Handbook, Chapter 14: Grading the certainty of the evidence GRADEの4段階、確実性を下げる5つの要因、ランダム化比較試験は高い確実性から出発すること https://www.cochrane.org/authors/handbooks-and-manuals/handbook/current/chapter-14
- Cochrane Library — About Cochrane Reviews 事前に定めた計画にしたがうという原則、プロトコルの公開 https://www.cochranelibrary.com/about/about-cochrane-reviews
- Page MJ, McKenzie JE, Bossuyt PM, et al. The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ. 2021;372:n71. 報告ガイドラインとしてのPRISMA、完全な報告が知見の信頼性の判断を可能にすること doi:10.1136/bmj.n71
- GRADE Working Group エビデンスの確実性を評価する枠組みの概要 https://www.gradeworkinggroup.org/
限界・注意点について
- Murad MH, Asi N, Alsawas M, Alahdab F. New evidence pyramid. BMJ Evidence-Based Medicine. 2016;21(4):125-127. エビデンスピラミッドの見直しの提案、システマティックレビューを「レンズ」として位置づける考え方 doi:10.1136/ebmed-2016-110401
- Page MJ, Shamseer L, Altman DG, et al. Epidemiology and Reporting Characteristics of Systematic Reviews of Biomedical Research: A Cross-Sectional Study. PLoS Medicine. 2016;13(5):e1002028. 未公表データの検索7%、プロトコル事前登録4%、バイアス評価70%のうち解析への反映16% doi:10.1371/journal.pmed.1002028
- Rethlefsen ML, Brigham TJ, Price C, et al. Systematic review search strategies are poorly reported and not reproducible: a cross-sectional metaresearch study. Journal of Clinical Epidemiology. 2024;166:111229. 100件のうち検索を完全に再現できたのは1件のみ doi:10.1016/j.jclinepi.2023.111229
- Hoffmann F, Allers K, Rombey T, et al. Nearly 80 systematic reviews were published each day: Observational study on trends in epidemiology and reporting over the years 2000-2019. Journal of Clinical Epidemiology. 2021;138. 2019年時点で1日あたり約80件という公表数の推計 doi:10.1016/j.jclinepi.2021.05.022
論文1本では判断できない理由について
- Turner EH, Matthews AM, Linardatos E, Tell RA, Rosenthal R. Selective Publication of Antidepressant Trials and Its Influence on Apparent Efficacy. New England Journal of Medicine. 2008;358(3):252-260. 規制当局登録74試験のうち31%が未公表、当局判定では51%が陽性だが公表論文では94%が陽性に見えた、効果量は全体で32%過大 doi:10.1056/NEJMsa065779
- Open Science Collaboration. Estimating the reproducibility of psychological science. Science. 2015;349(6251):aac4716. 100件の再現実験、元の研究97%が有意に対し再現実験では36%、効果量はおよそ半分 doi:10.1126/science.aac4716
システマティックレビューを作成する
サービスに関するご相談は、こちらよりお問い合わせください。
-1.png)

コメント