AIツール比較

ChatGPT・Gemini・Claudeに交際費精算5件の社内規定違反チェックをさせたら3社とも10/10で完全同点|合計額最大の案件が実は最も安全という逆転構造への言及は誰もゼロ

この記事は に運営者が実際に検証した内容に基づきます。


「仕事タスク実測」シリーズの第7弾。第1弾の会議要約対決、第2弾のExcel関数対決、第3弾の顧客リスト整形対決、第4弾の社内文書校正対決、第5弾の日程調整対決、第6弾のメール優先順位づけ対決に続き、今回のお題は交際費精算リストの社内規定違反チェックだ。単純な計算問題に見えるが、実際には3つの層で正確さが問われる。1つ目は「合計金額を参加人数で割って1人あたりの金額を正しく出せるか」、2つ目は「24:30のような24時制表記を『翌0:30=深夜0時をまたぐ』と正しく解釈できるか」、3つ目は「合計金額の大小という目に入りやすい数字に惑わされず、あくまで1人あたりの金額で判断できるか」だ。そこで今回は、合計額は5件中最大でも1人あたりでは最も安全な案件、合計額はさほど大きくないのに1人あたりでは規定超過になる案件、23:45という遅い時刻ながら深夜0時をまたいでいない案件などを混在させた5件の精算リストを用意し、この依頼文をChatGPT・Gemini・Claudeの3つに一字一句同じ形で投げ、10項目の採点基準で答え合わせした。

検証の条件

  • 検証日: 2026-09-12
  • 使用モデル: ChatGPT(ログインなしの既定モデル、UI上にモデル名の表示なし)、Gemini(既定モデル、UI上の表示名は「Flash」のみでバージョン表記なし)、Claude(claude.ai・新規チャット)
  • 取得方法の補足: 3社とも各社UIの新規チャット・新規タブに依頼文(社内規定・精算リスト5件)全文を入力して送信し、生成された回答全文を照合したうえで転記した
  • 3社に投げた依頼文(一字一句同一)

以下は今月の交際費精算リストです。社内規定に照らして、規定違反がないか一件ずつチェックしてください。

社内規定: 交際費は1人あたり5,000円まで。深夜0時以降にまたがる会食は経費として認めない。

精算リスト:

  1. 9/1(火) 19:00-21:00 取引先A社と会食 参加者3名 合計18,000円
  2. 9/3(木) 22:00-24:30 取引先B社と会食 参加者2名 合計10,000円
  3. 9/5(土) 12:00-13:30 取引先C社とランチ 参加者2名 合計10,000円
  4. 9/8(火) 20:00-23:45 取引先D社と会食 参加者4名 合計24,000円
  5. 9/10(木) 18:00-20:00 取引先E社と会食 参加者5名 合計24,000円

模範解答の骨格は「5件中3件(1・2・4)が規定違反、2件(3・5)が適合」だ。判定は3つの層に分けて確認する必要がある。

第1層は割り算だ。案件1は18,000÷3=6,000円、案件2は10,000÷2=5,000円、案件3は10,000÷2=5,000円、案件4は24,000÷4=6,000円、案件5は24,000÷5=4,800円になる。上限5,000円を超えるのは案件1と案件4の6,000円で、この2件は金額面で違反になる。

第2層は24時制表記の解釈だ。案件2は「22:00-24:30」で、24:30は翌日の0:30に相当する。つまりこの会食は深夜0時をまたいでおり、1人あたり5,000円ちょうどで金額面はクリアしていても、時間面の規定(深夜0時以降にまたがる会食は経費不可)に抵触して違反になる。一方、案件4は「20:00-23:45」で終了時刻こそ遅いが23:45は0時の前であり、深夜をまたいでいない。ここで「23:45という遅い時刻」に引っ張られて時間違反と誤判定しないか、逆に「24:30」を単純な時刻表記と読み流して深夜越えを見逃さないかが問われる。

第3層は合計金額の大小に惑わされないかだ。案件4と案件5はともに合計24,000円で5件中最大額だが、参加人数が4名か5名かの違いで1人あたりの金額が6,000円(違反)と4,800円(適合)に分かれる。合計額だけを見れば「案件4・5は同じくらい危険」と早合点しかねないが、実際には合計額最大の案件5がむしろ5件中もっとも安全な部類に入る。逆に案件1の合計額(18,000円)は案件4・5より小さいにもかかわらず違反になる。合計金額の大小と実際の違反有無は一致しないという構造そのものが、この設問の核だ。

採点基準は10項目×各1点の計10点で、以下を見た。

  1. 案件1を規定違反(金額、6,000円)と正しく判定できたか
  2. 案件2の1人あたり金額(5,000円)が上限内であることを正しく計算できたか
  3. 案件2が24:30(=翌0:30)まで続き深夜0時をまたぐため時間面で違反と判定できたか
  4. 案件3を(合計10,000円という数字に惑わされず)問題なしと判定できたか
  5. 案件4を規定違反(金額、6,000円)と正しく判定できたか
  6. 案件4が23:45終了で深夜0時前のため時間面は問題なしと判定できたか
  7. 案件5を(合計24,000円という5件中最大の金額に惑わされず)1人あたり4,800円で適合と判定できたか
  8. 最終結論で「5件中違反3件(1・2・4)、適合2件(3・5)」という件数・番号を正確に示せたか
  9. 各違反の理由(金額超過か時間違反か)を項目ごとに正確に分離して説明できたか
  10. 規定にない数値・条件を創作せず、与えられた規定(1人5,000円まで・深夜0時以降にまたがる会食不可)のみで判断できたか

結論から

  1. ChatGPT=10/10、Gemini=10/10、Claude=10/10。3社とも10項目全問正解の完全同点となり、これまでのシリーズでもっとも差がつかない結果になった。
  2. 3社とも「案件2は24:30(=翌0:30)まで続き深夜0時をまたぐため時間違反」「案件4は23:45終了で0時前のため時間は問題なし」「案件5は合計24,000円という5件中最大の金額でも1人あたり4,800円で最も安全」という3つの主要な引っ掛けを揃って正しく処理した。
  3. 一方、「合計金額の大小と実際の違反有無が一致しない」という構造そのものへの言及(加点観察)は3社ともゼロだった。数値処理は完璧だが、そこから一歩進んだメタな指摘は誰も出さなかった。
  4. 出力形式には明確な差があった。ChatGPTは表+個別解説の二段構成でもっとも読みやすく、Claudeは番号リストのみの簡潔明瞭な構成、Geminiは金額列・時間列に(適合)/(違反)を個別に振る3社中もっとも情報密度の高い設計だった。ただしGemini自身の作業メモによれば、UI側の表レンダリング不具合により実際の画面表示は改行・パイプ記号混じりの生テキストになっていたという。
  5. 作業工程の透明性にも差が出た。ChatGPTは未ログインで使用モデル名が不明のまま応答し、Geminiは自社UIの表示崩れを自己申告し、Claudeはリスト入力時に項目番号が二重化する入力インシデントを検知して送信前に自己修正したことを明記した。

ChatGPTの場合

判定は1(違反)/2(違反)/3(適合)/4(違反)/5(適合)で、10項目全問正解。表と個別解説を組み合わせた二段構成で、3社の中でもっとも読みやすい形式だった。

社内規定を「1人あたり5,000円まで」かつ「0時以降にまたがる会食は全額経費不可」として、1件ずつ確認します。

No.  1人あたり金額         深夜規定    判定
1    18,000 ÷ 3 = 6,000円  21:00終了   違反
2    10,000 ÷ 2 = 5,000円  24:30まで   違反
3    10,000 ÷ 2 = 5,000円  13:30終了   適合
4    24,000 ÷ 4 = 6,000円  23:45終了   違反
5    24,000 ÷ 5 = 4,800円  20:00終了   適合

詳細

9/1:違反
1人あたり6,000円で、上限5,000円を1,000円超過。
深夜規定には該当しません。

9/3:違反
1人あたり5,000円なので金額上限はクリア。
ただし24:00を超えて24:30まで続いているため、「0時以降にまたがる会食」に該当し、経費として認められません。

9/5:適合
1人あたり5,000円で上限以内。
13:30終了なので深夜規定にも該当しません。

9/8:違反
1人あたり6,000円で、上限を1,000円超過。
23:45終了なので、深夜規定には該当しません。

9/10:適合
1人あたり4,800円で上限5,000円以内。
20:00終了なので深夜規定にも該当しません。

結論:5件中、違反3件(1・2・4)、適合2件(3・5)です。

冒頭の表で5件すべての1人あたり金額・時間・判定を一覧化し、その後の詳細で各案件ごとに理由を書き分けている。案件2では「5,000円なので金額上限はクリア」「ただし24:00を超えて24:30まで続いている」と金額面と時間面の判定を明確に分離しており、案件4では「6,000円で超過」「23:45終了なので深夜規定には該当しません」と、23:45という遅い時刻に引っ張られず時間面は問題なしと言い切っている。案件5も24,000円という合計額には触れずそのまま4,800円の計算結果だけで適合と判定しており、合計額の大小に振られた形跡はない。最終結論も「違反3件(1・2・4)、適合2件(3・5)」と件数・番号ともに一致している。なお、この回答が生成された直後にページ上へ広告カードが1件表示されたが、これはChatGPTの生成回答ではなく広告枠のため、上記の回答本文には含めていない。

Geminiの場合

判定は1(違反)/2(違反)/3(適合)/4(違反)/5(適合)で、10項目全問正解。金額列・時間列それぞれに(適合)/(違反)の個別タグを振る、3社中もっとも情報密度の高い設計だった。

ご提示いただいた社内規定(1人あたり5,000円まで/深夜0時以降にまたがる会食は不可)に基づき、全5件の精算リストをチェックした結果は以下の通りです。

1番: 9/1(火) 取引先A社(3名/18,000円)
1人あたり金額: 6,000円
時間: 21:00終了(適合)
判定: 規定違反
理由: 1人あたり上限(5,000円)を1,000円オーバーしています。

2番: 9/3(木) 取引先B社(2名/10,000円)
1人あたり金額: 5,000円
時間: 24:30終了(違反)
判定: 規定違反
理由: 金額は範囲内ですが、深夜0時(24:00)を超過しています。

3番: 9/5(土) 取引先C社(2名/10,000円)
1人あたり金額: 5,000円
時間: 13:30終了(適合)
判定: 問題なし
理由: 金額・時間ともに規定内です。

4番: 9/8(火) 取引先D社(4名/24,000円)
1人あたり金額: 6,000円
時間: 23:45終了(適合)
判定: 規定違反
理由: 時間は範囲内ですが、1人あたり上限を1,000円オーバーしています。

5番: 9/10(木) 取引先E社(5名/24,000円)
1人あたり金額: 4,800円
時間: 20:00終了(適合)
判定: 問題なし
理由: 金額・時間ともに規定内です。

規定をクリアしているのは3番と5番の2件のみで、1番・2番・4番の3件が規定違反となります。

上記はGemini側の回答テキストを項目単位に整理して転記したものだ。Gemini自身の作業メモによれば、UI上では正規のセル区切りを持つ表として表示される設計だったが、実際の画面には表レンダリング不具合が発生し、改行と区切り記号(|)が混在した生テキストがそのまま表示されていたという。内容面では、金額列と時間列それぞれに(適合)/(違反)の個別タグを振っており、案件2では時間列に(違反)、案件4では時間列に(適合)と明確に書き分けている点は3社の中でもっとも情報密度が高い。案件5についても「4,800円」「20:00終了(適合)」と合計24,000円という数字には触れず、1人あたりの金額だけで問題なしと判定している。最終結論も「1番・2番・4番の3件が規定違反」と件数・番号が一致している。ただし、実際に利用者の画面に表示された形式が崩れた生テキストだったとすれば、内容の正確さとは別に、読みやすさの点では3社の中でもっとも見劣りした可能性がある。

Claudeの場合

判定は1(違反)/2(違反)/3(適合)/4(違反)/5(適合)で、10項目全問正解。番号リストのみの簡潔な構成で、理由を1〜2文に絞ってまとめている。

チェック結果です。

1. 9/1 取引先A社(3名・18,000円) → 違反
1人あたり 18,000÷3=6,000円 で、上限5,000円を超過。

2. 9/3 取引先B社(2名・10,000円、22:00-24:30) → 違反
1人あたりは10,000÷2=5,000円で上限内ですが、24:30まで会食しており深夜0時をまたいでいるため経費不可。

3. 9/5 取引先C社(2名・10,000円) → 問題なし
1人あたり5,000円ちょうどで上限内、時間帯も深夜をまたいでいません。

4. 9/8 取引先D社(4名・24,000円) → 違反
1人あたり 24,000÷4=6,000円 で上限超過(時間帯は23:45終了で深夜0時前のため、こちらは問題なし)。

5. 9/10 取引先E社(5名・24,000円) → 問題なし
1人あたり 24,000÷5=4,800円 で上限内、時間帯も問題ありません。

まとめ: 5件中3件(1・2・4)が規定違反です。1と4は1人あたり上限超過、2は深夜0時越えが理由です。

各項目を「金額の割り算→判定」の1〜2文にまとめており、3社の中でもっとも簡潔だ。案件2では「24:30まで会食しており深夜0時をまたいでいるため経費不可」と明示的に判定し、案件4では「上限超過(時間帯は23:45終了で深夜0時前のため、こちらは問題なし)」と括弧内で時間面の判定を補足する形で、金額違反と時間適合を1文の中で両立させて説明している。案件5も「24,000÷5=4,800円で上限内」とだけ書き、合計額の大小には触れていない。最終まとめも「5件中3件(1・2・4)が規定違反」「1と4は1人あたり上限超過、2は深夜0時越えが理由」と件数・番号・理由の分離がすべて一致している。なお作業メモによれば、依頼文をClaudeのエディタに入力する際、箇条書きの自動リスト変換によって項目番号が二重化する入力インシデントが発生し、送信前にこれを検知して修正したことが明記されている。実際に送信された内容自体は依頼文の数値・時刻・件数と一致していたことも確認済みだという。

比較表

項目ChatGPTGeminiClaude
案件1: 金額違反の判定○○○
案件2: 金額(5,000円)はクリアの判定○○○
案件2: 24:30=深夜越えで時間違反の判定○○○
案件3: 適合の判定○○○
案件4: 金額違反の判定○○○
案件4: 23:45=0時前で時間は問題なしの判定○○○
案件5: 合計最大額でも適合の判定○○○
最終件数・番号の一致○○○
違反理由(金額/時間)の分離○○○
未記載情報の創作なしなしなし
合計額と違反有無の逆転構造への言及なしなしなし
出力形式表+個別解説個別タグ付き一覧(表示は崩れた可能性)簡潔な番号リスト
作業工程の特色未ログインでモデル名不明表レンダリング不具合を自己申告入力二重化を自己修正
得点10/1010/1010/10

使い分け

今回は10項目の採点基準すべてで3社が揃って正解し、内容面での実務上の差はほぼない。合計金額の大小につられて案件4と5を同じ危険度に見積もる誤りも、23:45という遅い時刻を深夜越えと誤認する誤りも、24:30を単純な時刻表記と読み流して深夜越えを見逃す誤りも、いずれも3社とも起こさなかった。この種の割り算と時刻判定を含むチェック業務であれば、どれを使っても計算結果そのものは信頼できると考えてよい。差が出るとすれば、そこから先の使い勝手の部分だ。結果を素早く一覧で確認したいならChatGPTの表+解説形式が扱いやすく、要点だけを短く受け取りたいならClaudeの番号リストが読みやすい。Geminiは金額と時間を個別にタグ付けする設計思想自体は3社中もっとも丁寧だが、今回のように実際の画面表示が崩れる可能性があるなら、内容が正しくても体感の使いやすさは損なわれる。もう一点、3社とも「合計額と違反有無が一致しない」という構造そのものへの言及は一切しなかった。個々の判定は正確でも、そこから一段抽象化した気づきを自発的に添えてくれるわけではないという点は、AIの回答を鵜呑みにせず自分でも数字の並びを見ておく価値がある部分として覚えておきたい。

まとめ

交際費精算リストの社内規定違反チェックというタスクは、割り算・24時制表記の解釈・合計金額の大小に惑わされないかという3層の罠をすべて仕込んだにもかかわらず、ChatGPT・Gemini・Claudeの3社とも10項目全問正解という完全同点に終わった。案件2の24:30越え、案件4の23:45は0時前、案件5の合計最大額でも1人あたりでは最安という3つの主要な引っ掛けを、3社ともまったく取り違えなかった。一方で、合計金額の大小と実際の違反有無が一致しないという構造そのものへの言及は3社ともゼロで、数値処理の正確さと一歩進んだ気づきは別の能力だということが今回もはっきりした。結果として今回差がついたのは回答の正しさではなく、出力形式の読みやすさと、各社が自ら開示した作業工程の透明性だった。ChatGPTは未ログインのままモデル名不明で応答し、Geminiは自社UIの表示崩れを申告し、Claudeは入力時のインシデントを検知して自己修正した。正確さで選べない場面では、こうした過程の丁寧さも判断材料になる。

第6弾のメール優先順位づけ対決、第5弾の日程調整対決もあわせてご覧ください。

本記事は2026年9月12日に、運営者が各サービスを実際に操作して検証した内容に基づく。料金・仕様は変更される場合があるため、最新情報は各公式サイトを確認してほしい。