本文へスキップ

求職者向け

AIチェッカーの精度を記事6本で実測、AI率を評価に使える条件

AIチェッカーの精度を記事6本で実測、AI率を評価に使える条件

応募書類を読んでいて、どこか整いすぎた文章に手が止まったことはないでしょうか。提出されたレポートを前に、これは本人が書いたものかと迷った経験があるかもしれません。

AIチェッカーに貼ってはみたものの、出てきたパーセントをどう扱えばいいのか決めきれない。そんな方も多いはずです。

どう扱えばよいかは、実際に測ってみると見えてきます。ここでは、公開されている記事6本を同じ条件で通した結果をそのまま載せます。

AIチェッカーのAI率は、評価の根拠にしてよいのか

6本の記事を無料のAIチェッカーにかけたところ、そのうち1本で、ツールによって数字が正反対になりました。想像ではなく、EDAのブログで実際に起きたことです。ただし、どの文章でも必ずこうなる、という話ではありません。

同じ1本が、0%と99.7%に割れた

EDAのブログで公開している記事6本から本文の冒頭1,500字を切り出し、同じ文章のまま無料のAIチェッカーに貼って判定させました(2026年9月7日)。

そのうち、社員が勉強会に参加した体験を書いた1本はどうなったか。ZeroGPTのAI率は0%、SaplingのAI率は99.7%でした。

同じ日に、同じ文章を貼っています。先に開いたのがSaplingだったら、その担当者は、社員が自分の体験を書いた文章を「AI率99.7%」として上司に報告していたはずです。

6本すべてがこうなったわけではありませんし、別の日に別の文章で試せば、また違う出方をするはずです。それでも、1本でもこうなるなら、いま画面に出ている数字がその1本ではないと言い切る根拠が要ります。2つの数字を並べて見せられた側は「どちらを信じればいいのか」と迷い、見比べる数字が増えるどころか、判断できることは減っていきます。

ツールが使いものにならない、という話でもありません。今回の結果は無料版・日本語・冒頭1,500字・1日だけという条件のもとで出たもので、各ツールの性能そのものを試験したわけではありません。有料版や英語の文章なら、違う出方をする可能性があります。

「AI率」は、書きぶりから計算した推定値

文章の書きぶりだけを見て書き手を言い当てようとする点では、応募書類を1枚読んで人物像を思い浮かべる作業に近いものです。推定である以上、外れることがあります。そして外れたかどうかは、画面に出たパーセントを眺めても分かりません。

判定の難しさは、生成AIを作っている側も認めています。ChatGPTを開発したOpenAIは、AIが書いた文章を見分けるツール「AI Text Classifier」を公開したものの、精度が低いとして2023年7月20日に提供を終了しました。

公開時にOpenAIが公表していた自己評価(OpenAI)は、AIが書いた英語の文章のうち正しく検出できたのが26%、人が書いた文章の9%をAIと誤って判定した、という数字でした。

AIチェッカーのAI率は、評価の根拠にしてよいのかの図解

無料で日本語の文章を試せるAIチェッカーはどれか

AI率が推定値にすぎないと分かっても、手元の1本は机の上に残ったままです。では、その文章はどのツールに貼れるのでしょうか。今回貼って確かめた3つのうち、日本語がそのまま通ったのは2つでした。

貼って確かめた3つのツール

ツール 日本語をそのまま貼れたか 無料のまま結果が出たか 結果の示され方
ZeroGPT 貼れた 出た AI率のパーセントと、英語の判定文が1行
Sapling 貼れた 出た AIが書いた確率のパーセント
GPTZero 言語の選択肢に日本語が無い 日本語では試せず 今回は結果を得られなかった

つまり、日本語の文章をそのまま試せたのはZeroGPTとSaplingの2つです。以降の実測も、この2つで行っています。

GPTZeroの言語の選択肢に、日本語が無い

GPTZeroは判定の前に文章の言語を選ぶ仕組みで、選べたのは English / Español / Français / Deutsch / Português の5つだけでした(2026年9月7日に確認)。日本語の項目がありません。

公式のよくある質問でも、判定モデルが対応する言語として英語・スペイン語・フランス語・ドイツ語などが挙げられており、日本語は書かれていません(GPTZero、2026年9月7日確認)。

貼り付けてから気づくと、それだけで時間を取られます。海外製のツールを開いたら、文章を貼る前に言語の選択肢を見てください。

日本語の判定に対応したのは、2025年から

大学や研究機関で使われる有料の判定サービスTurnitinが、日本語の提出物に対応したAIライティング検知機能の提供を始めたのは2025年4月2日です(Turnitin(ターンイットイン・ジャパン))。英語で先に動いていた仕組みが日本語に広がったのは、2025年に入ってからでした。

公開記事6本を同じ文章で通した判定結果

貼れるツールが2つに絞れたところで、その2つが同じ文章をどう判定したのかを見ていきます。公開記事6本を通した結果を、そのまま載せます。

6本をどう測ったか

対象はeda-inc.jpで公開している記事6本です。本文の冒頭1,500字だけを切り出し、加工せずに同じ文章を各ツールへ貼りました。判定はすべて2026年9月7日に行っています。

公開記事6本を同じ文章で通した判定結果の図解

長さを揃えたのは、貼る範囲が違うと結果の差がどこから来たのか分からなくなるためです。片方に全文、もう片方に冒頭だけを貼れば、ツールの違いと長さの違いが混ざります。

内訳は、社員が書いた3本と、AIが下書きを作って人が内容を確認したうえで公開した3本。後者は、この記事と同じ仕組みで作られた記事です。

  • 社員が書いた3本: 札幌支社メンバーのAI駆動開発勉強会の参加記事、レビュワー支援ツールをレビューイが使ってみた記事、札幌のITキャリアセミナーの登壇報告
  • AIが下書きした3本: LLM Wikiの解説記事、Evalエンジニアリング入門、AIへのデザイン指示の書き方

ここは正直に書いておきます。上の3本について、「AIを一切使っていない」と言い切ることはできません。社員が書いた記事であることは分かりますが、下書きや推敲でAIに手伝わせたかどうかまでは記録が残っていないためです。裏を返すと、確実に「AIが関わった」と言えるのは下の3本だけになります。

そして、この事情は書類を受け取る側とまったく同じです。「AIを一切使っていない文章」を用意すること自体が、もう難しくなっています。 判定ツールが当たるかどうかを論じる前に、比べる相手が手元に無い。以下の結果は、そこを踏まえて読んでください。

6本の判定結果

表の数値は、いずれも「AIが書いた確率」として画面に表示されたものです。

記事(冒頭1,500字) 書き方 ZeroGPTのAI率 SaplingのAI率
AI駆動開発勉強会の参加記事 社員が執筆 0% 99.7%
レビュワー支援ツールを使ってみた 社員が執筆 0% 95.6%
ITキャリアセミナーの登壇報告 社員が執筆 0% 0.1%
LLM Wikiの解説記事 AIが下書き 0% 0.0%
Evalエンジニアリング入門 AIが下書き 44.4% 0.0%
AIへのデザイン指示の書き方 AIが下書き 0% 1.7%

上の3行が社員の書いた記事、下の3行がAIが下書きした記事です。列ごとに縦に見ていくと、2つのツールの外れ方がはっきり分かれます。

Saplingは、AIが下書きした3本を全部見逃した

確実に言えるのはこちらです。AIが下書きしたと記録が残っている3本を、Saplingは3本とも2%未満の「人間」と判定しました(0.0%、0.0%、1.7%)。AIが関わったことがはっきりしている文章を、1本も拾えていません。

一方、社員が書いた3本のうち2本には99.7%95.6%が出ました。この2本に下書きや推敲の段階でAIの手が入っていた可能性は、先に書いたとおり否定できません。ただ、仮に入っていたとしても、AIが下書きしたと分かっている3本より高い数字が出ているという並びは変わりません。同じ社内の、同じ日に測った6本です。

この結果だけを見て判断していたら、社員が体験を書いた記事を差し戻し、AIが下書きした記事をそのまま通していたことになります。

ZeroGPTは、6本中5本が0%

ZeroGPTのほうは、6本のうち5本が0%でした。0%でなかったのはAIが下書きしたEvalエンジニアリング入門の44.4%だけで、社員が書いた記事とAIが下書きした記事が数字の上で分かれていません。

同じ勉強会の参加記事が、ツールを変えるだけで0%にも99.7%にもなります。どちらの画面を先に見たかで、上司に上げる報告が変わってしまいます。

同じ0%でも判定文が違う、パーセントだけでは見落とすこと

6本の数字を並べたところまでは、パーセントの話でした。ただ、ZeroGPTの画面には、そのパーセントの横に英語の判定文が1行表示されます。この文まで読まないと、結果の意味を取り違えます。

同じ0%の裏に、4通りの文が出た

6本のうち5本が0%だったZeroGPTですが、その0%に添えられた文は同じではありませんでした。

  • 社員が書いた勉強会の参加記事:「Your Text contains mixed signals, with some parts generated by AI/GPT」(AIが生成した部分が混じっている、という意味)
  • 社員が書いたレビュー記事と、AIが下書きしたLLM Wikiの解説記事:「Your Text is Human written」(人が書いたもの)
  • 社員が書いた登壇報告:「Your Text is Likely Human written, may include parts generated by AI/GPT」(おそらく人が書いたが、AIが生成した部分を含むかもしれない)
  • AIが下書きしたデザイン指示の記事:「Your Text is Most Likely AI/GPT generated」(ほぼAIが生成したもの)

最後の1本を見てください。AI率は0%と表示されているのに、文のほうは「ほぼAIが生成」と言っています。数字と文が食い違ったまま、同じ画面に並んでいるのです。

同じ0%でも判定文が違う、パーセントだけでは見落とすことの図解

パーセントだけを切り取らない

これは無料版に日本語の文章を貼ったときの挙動です。ツールの側も、パーセント1つで人事や成績の判断をされることを想定していないのかもしれません。

同僚や上司に結果を渡すときは、パーセントと一緒に、表示された判定文と貼った日付も残してください。「0%でした」とだけ伝えると、4通りのうちどれだったのかが消えます。

どういう文章が「AIが書いた」と判定されるのか

ここが一番知りたいところだと思います。判定ツールは、書き手が誰かを調べているのではありません。見ているのは文章の予測しやすさです。

判定の中身は「次の語が読めるかどうか」

AIは、次に来る確率がもっとも高い語を選んで文章を作ります。そのため、AIが書いた文章は「次の語が読める」形になりやすい。判定ツールはこの読みやすさをパープレキシティという指標で測り、読めるほどAI寄りの数字を出します。

やっかいなのは、人が書いても同じことが起きる点です。スタンフォード大学の研究者らは、英語を母語としない人が書いたTOEFLのエッセイの半数以上を、判定ツールがAI生成と誤って分類したと報告しています。米国の8年生が書いた作文ではほぼ正確に判定できていたにもかかわらずです。原因として挙げられているのは、語彙の幅が狭く、パープレキシティが低くなることでした(Liang et al., Patterns, 2023)。

つまり、AI率が高く出るのは「AIが書いたから」とは限らず、「書き方が読みやすい方向に寄っているから」でもあるということです。

文ごとのスコアを取り出して、何が違うのかを数えた

Saplingは、記事全体のパーセントとは別に、文ごとのスコアも返します。今回の6本から10字以上の文を169文取り出し、その文に「具体の情報」がいくつ入っているかで分けました。数えたのは次の4種類です。

  • 数字(日付・件数・割合)
  • カッコ書きの出典や補足
  • 英字の固有名詞
  • 人名・社名
1文に入っている具体の情報 文の数 平均AI率
0個 67文 89.5%
1個 57文 72.7%
2個 33文 61.0%
3個 12文 13.0%

具体が増えるほど、AI率がまっすぐ下がりました。予測しやすさで測っているという説明と、実際の数字が合っています。固有名詞や数字は、次に何が来るか読めません。

AI率が高く出た文と、低く出た文

同じ6本の中から、両端の文をそのまま並べます。

AI率が高く出た文:

  • 100.0%「必要なのはセンスではなく、指示に使える言葉です。」
  • 100.0%「読んで筋が通っていれば納得はできますが、納得することと理解することは違います。」
  • 99.9%「今回の登壇を通じて、自分の経験を言語化することで改めて気づくことが多くありました。」
  • 100.0%「そんな往復を繰り返していないでしょうか。」

AI率が低く出た文:

  • 0.0%「米国(18.5%)、ドイツ(16.5%)、中国(32.9%)を上回り、4か国中でもっとも高い割合でした(総務省)。」
  • 0.0%「Karpathy氏の設計では、全体が3つの層の重なりとして描かれています。」
  • 0.0%「株式会社イーディーエー(EDA Inc.)スマホアプリ・Flutter開発・業務DX支援」

高く出たほうは、一般論の言い切り、内省、読者への問いかけです。低く出たほうは、数字・出典・固有名詞が入った事実の記述です。文章の巧拙ではありません。

ここが効きます: 志望動機や自己PRは、まさに前者の書き方になります。固有名詞も数字も入れず、心境と一般論で埋めた文章です。丁寧に書かれた志望動機ほど、AI率が高く出やすいと考えてください。

文のスコアを足しても、記事のスコアにはならない

ただし、この関係は文の中の話にとどまります。記事全体のパーセントは、文のスコアの平均ではありませんでした。

  • 登壇報告(記事全体0.1%)は、具体の情報がゼロの文が64%と6本で最も多く、文のスコアの平均も82.4%でした。それでも記事全体は0.1%です。
  • 勉強会の参加記事(記事全体99.7%)は、文あたりの具体がもっとも多く、文のスコアの平均は67.8%でした。それでも記事全体は99.7%です。

文ごとの数字を見ても、記事に出るパーセントは予想できません。ツールの中で何をどう足しているのかは、画面に出てくる数字からは追えないということです。

なぜ判定が外れるのか

「そもそも、なぜ外れるのか?」と引っかかった方もいるのではないでしょうか。数字と判定文の両方を見ても、その理由は画面から分かりません。外し方には2種類あります。書類選考で、条件に合う人を落としてしまうのと、合わない人を通してしまうのがあるのと同じです。

該当しない文章を、AI扱いする外し方(偽陽性)

本当は違うのに「該当する」と出る外し方を、偽陽性と呼びます。採用・編集・教育のどの立場でも、怖いのはこちらです。「AI率95.6%でした」と本人に伝えてしまえば、後から取り消しても、言われた側の受け取り方は元に戻りません。

今回の6本で、この外し方が実際に起きたと言い切ることはできません。社員が書いた3本にAIの手が入っていないことを、こちらが証明できないからです。

ただ、証明できないこと自体が問題を示しています。95.6%と出された側も、「使っていません」を裏づける手立てを持っていません。数字を突きつけられた人は、反証のしようがないところに立たされます。

そのうえ、上で見たとおり、AI率が上がる方向に効くのは「AIを使ったこと」ではなく「具体の少ない書き方」でした。誠実に心境を書いた人ほど不利になる、という向きの外れ方です。

該当する文章を、人間と見なす外し方(偽陰性)

もう1つは逆向きの外れ方で、本当は該当するのに「該当しない」と出ます。偽陰性と呼ばれるものです。

こちらは今回の6本で確定しました。AIが下書きしたと記録が残っている3本を、Saplingは3本とも2%未満の人間と判定しています。ZeroGPTでも、その3本のうち2本が0%でした。

判定ツールごとに、外し方の差が大きい

AI率は文章の書きぶりから計算した数字であって、その文章が実際にどう書かれたかを確認したものではありません。断定の根拠にならない理由は、ここにあります。

シカゴ大学ブース経営大学院の研究者が、人とAIが書いた文章を大量に集めて商用・オープンソースの判定ツール4つ(Pangram、OriginalityAI、GPTZero、RoBERTa)を検証したところ、人の文章をAIと誤判定する割合を0.5%以下に抑えたままAIの文章も見つけられたのは、4つのうち1つだけでした(University of Chicago, Becker Friedman Institute、2025年8月)。対象は英語の文章です。

なぜ判定が外れるのかの図解

この測り方で言えないこと

今回の実測から「日本語は苦手だ」と一般化はできません。確かめられたのは、GPTZeroの言語選択に日本語が無かったことと、日本語の記事6本でこの結果になったことの2つだけです。

もう1つ、はっきりさせておくことがあります。この6本のうち、「AIが関わった」と確実に言えるのは3本だけです。 残りの3本は社員が書いたものですが、下書きや推敲でAIを使ったかどうかの記録がありません。そのため、偽陽性が起きたかどうかは今回の測り方では判定できません。判定ツールを正しく検証するには、書き方の記録が最初から残っている文章を集める必要があります。

文ごとのスコアを数えた169文も、6本の中だけの話です。「具体を増やせばAI率が下がる」と言えるのは文の単位までで、記事全体のパーセントを下げる方法としては確かめられていません。

6本、冒頭1,500字、無料版、1日。この条件で出た結果であり、各ツールの性能を統計として測ったものではありません。

AI率を不採用や成績の根拠にする前にできること

外し方が2種類あると分かっても、すでに出てしまった数字が消えるわけではありません。では、その数字をどう扱えばよいのでしょうか。やることは2つで、数字を判断から外すことと、本人に聞く場をつくることです。

AI率を不採用や成績の根拠にする前にできることの図解

単独の根拠にはしない

AI率だけを理由に、不採用・差し戻し・成績評価を決めないでください。同じ文章が0%と99.7%になる以上、その数字は社内でも学内でも説明が通りません。

見落とされやすいのは、逆向きの使い方のほうです。「AI率が低かったので問題なし」も、同じ理由で成り立ちません。今回、AIが下書きしたと分かっている3本は、Saplingで2%未満、ZeroGPTでも3本中2本が0%でした。低い数字は、安心してよい理由になりません

これは外部からの注文ではありません。文部科学省は大学・高専に宛てた事務連絡で、AIが生成した文章かを判定するツールを学修成果の評価等に活用する場合でも、その結果を過信しないことが重要である、と明記しています(文部科学省 高等教育局、令和5年7月13日付。2026年9月時点でも大学・高専向けの最新の周知です)。

では、ツールを作っている側はどう言っているのでしょうか。GPTZeroは公式のよくある質問で、これらの結果を学生の処分に使うべきではないとしたうえで、学生の作業を総合的に評価するときの一つの手がかりとして使うよう勧めています(GPTZero、2026年9月7日確認)。

判定結果を見せずに、内容を尋ねる

本人に切り出すとき、画面のパーセントを見せる必要はありません。聞くのは、書かれている中身のほうです。

  • 「この部分に書かれている◯◯について、もう少し詳しく聞かせてもらえますか?」
  • 「どういう順番で調べて、この結論になりましたか?」

自分で書いた人なら、調べた順番や書かなかったことを自分の言葉で説明できます。ここで話が続かなかったとしても、それはAIを使った証拠ではなく、もう一度確かめるための手がかりです。

AI率は、本人に確認するきっかけとしてだけ使ってください。

共有するときは、パーセントだけを渡さない

上司や同僚に結果を渡すときは、次の5つをセットで残してください。あとから同じ条件で確かめ直せます。

  • 使ったツールの名前
  • 判定した日
  • 貼った文字数と、書類のどの範囲を貼ったか
  • 表示されたパーセント
  • 表示された判定文(英語ならそのままの文で)

提出される前に、使ってよい範囲を書いておく

出てきた文章を後から判定するより、募集や課題の時点で書いておくほうが早く済みます。使ってよい範囲と申告のしかたを1文添えるだけで、後から疑う場面そのものが減ります。

  • 採用: 「応募書類の作成に生成AIを使った場合は、使った範囲を1行で書き添えてください」と募集要項に足します。使ったこと自体を選考で不利には扱わない、と続けておくと申告が集まります
  • 編集: 「下書きに生成AIを使う場合は、事実関係をご自身で確認したうえで、入稿時に使用範囲をお知らせください」と執筆依頼の文面に入れます
  • 教育: 「レポートで生成AIを使ってよいのは◯◯までとし、使った箇所とAIに与えた指示文を末尾に記載すること」と課題の指示に書きます

よくある質問(FAQ)

事前のルールまで決まると、残るのは細かい疑問です。確かめた範囲と確かめていない範囲を分けて答えます。

Q. 有料版なら精度は上がりますか?

今回試したのは各ツールの無料版だけなので、有料版については断定できません。ただ、同じ文章の判定が0%と99.7%に割れる以上、有料版に切り替えたとしても、出た数字を単独の根拠にしない前提は変えないほうが安全です。検討するなら、書き手が分かっている文章を何本か用意して、自分の手元で確かめてから決めてください。

Q. 大学のレポートでも、AIチェッカーの結果だけで判断してよいですか?

結果だけで判断しないでください。文部科学省も判定ツールの結果を過信しないよう周知しており、判定ツールの提供元自身が、結果を学生の処分に使うことを勧めていません。学内の規程を確認したうえで、本人への聞き取りを先に置いてください。

Q. 人の目でAIが書いた文章を見分けるコツはありますか?

文体の見た目から見分けるのは、かなり難しいと考えてください。日本語を対象にした2025年10月の査読論文では、日本人403名に文章を読ませて書き手を当てさせたところ、人が書いた文章を正しく「人が書いた」と判定できた参加者は31.5%にとどまりました(PLOS ONE)。見た目を疑うより、書かれている事実や体験の中身を本人に尋ねるほうが確かめられます。

Q. AI率を下げるために、書き方を変えさせるのはありですか?

やめてください。今回の測定では、数字や固有名詞が入った文ほどAI率が下がりました。ただしそれは文の単位の話で、記事全体のパーセントを下げる方法としては確かめられていません。それ以前に、判定をすり抜けるための書き換えを求めるのは、書き手に無意味な作業をさせることになります。ツールに合わせて人の書き方を変えるのではなく、数字を判断の根拠から外してください。

Q. 応募書類をそのまま貼っても大丈夫ですか?

貼る前に、入力した文章がどう扱われるかを各サービスの規約で確認してください。氏名・連絡先・所属など個人が特定できる部分は外してから貼るのが安全です。応募者から預かった書類である以上、社内の個人情報の取り扱いルールにも当たっておいてください。

Q. どのくらいの長さを貼ればいいですか?

今回は全ツールで本文の冒頭1,500字に揃えました。長さや範囲を変えると結果も変わりうるので、2つ以上のツールで比べるときは、同じ文章を同じ長さで貼ってください。片方は全文、片方は冒頭だけという比べ方をすると、差がどこから来たのか分からなくなります。

手元の1本が気になったとき、何から始めるか

「結局、目の前の1本はどうすればいいのか?」ここまで読んでも、そこは決まっていないと思います。判定の数字が使えないと分かったところで、目の前の文章が消えるわけではありません。

順番はこうです。

  1. 低い数字ほど、真に受けない。 AIが下書きしたと分かっている3本は、0.0%・0.0%・1.7%でした。「AI率が低いから大丈夫」は、この6本で一度も当たっていません。高い数字より、低い数字のほうが危ないと考えてください。
  2. 高い数字が出たら、まず文章の書き方を疑う。 具体の情報が入っていない文ほどAI率が上がります。志望動機や感想文のように、固有名詞も数字も入らない文章は、書いたのが誰であっても高く出ます。数字を見て人を疑う前に、そういう文章かどうかを見てください。
  3. 数字は判断から外し、中身を尋ねる場をつくる。 判定結果は見せず、書かれている事実や調べた順番を本人に聞きます。ここは人が読むしかありません。
  4. 次の募集要項・執筆依頼・課題指示に、1文足す。 出てきた文章を後から疑うより、こちらのほうが確実です。文面は上に載せたものをそのまま使えます。

同じ1本の記事が、ツールを変えるだけで0%にも99.7%にもなりました。上がっていたのは、AIを使った度合いではなく、具体の少なさのほうでした。そのうえ、AIを使っていないと言い切れる文章は、こちらの手元にも1本も残っていません。パーセントは、疑いを晴らす道具にも、疑いを固める道具にもなりません。確かめられるのは、書いた本人とのやり取りのほうです。

← ブログ一覧へ