ooligo
claude-skill

Screen interview records for identity and answer-provenance fraud

Difficulty
上級
Setup time
90min
For
recruiter · talent-acquisition · recruiting-engineer
Recruiting & TA

Stack

面接の書き起こしと、ATS がすでに保持しているプロセスのメタデータを読み、候補者ごとに裏付けレポートを返す Claude スキルです。記録が裏付けている点、矛盾している点、未解決のまま残る質問を切り分けます。フラグが立った候補者はライブ検証ステップに進みます。不採用には進みません。このスキルには不採用を支えられる出力フィールドが 1 つも存在せず、その理由は次のセクションの計算が示します。

動画ファイルには一切触れません。顔の幾何形状も、声紋も、まばたき頻度も、感情スコアリングもありません。この制約こそが設計であり、設計の欠落ではありません。

設計を決める数字

不正スクリーニングは基礎率で生死が決まります。ライブ面接に到達する不正候補者の事前確率が 2%、検出率 80%、偽陽性率 5% のスクリーニングなら、あるフラグが本物である確率は 24.6% です。4 件のうち 3 件は無実の人です。事前確率を 10% に上げても同じスクリーニングで 64%。これも誰かを不採用にできる数字ではありません。

だからこのスキルはフラグを検証へ回し、そこで止まります。45 分の構造化フォローアップ面談でほとんどが解消し、その会話の結果が採用判断に届きます。スコアではありません。この設計は NYC Local Law 144 やカリフォルニア FEHA の ADS 規則における自動意思決定システムの枠組みからワークフローを外し、FCRA の論点も狭めます。CFPB の Circular 2024-06 は、雇用判断に使われる労働者に関する第三者のアルゴリズムスコアを FCRA の対象に位置づけ、同意・開示・不利益措置前通知の義務を課しています。会話を起動する社内スクリーニングと、オファーを左右する購入済みスコアは、立っている場所が違います。スキルはこれを法務への質問として出力し、自分で答えません。

使うべき場面

  • 完全リモートの求人で、面接だけが応募者と本番環境の認証情報の間に立っている場合。
  • 初日より前に機材を発送する職種。発送先住所と本人確認書類の住所の食い違いは、リストで最も安価なシグナルであり、誰も見ていません。
  • 候補者の書面での成果物とライブ回答が別人のように読めるのに、リクルーターが理由を言語化できない場合。
  • 北朝鮮 IT 労働者の脅威面に入る企業のセキュリティ職や IT 職。国連専門家パネルの推計はこのプログラムの年間収益を 2 億 5,000 万〜6 億ドルとし、CrowdStrike は北朝鮮のアクターが米国を中心とする 100 社超のテクノロジー企業で内部者になりすましたと報告しています。

使うべきでない場面

  • 誰かを不採用にするため。 上の計算のとおりです。24.6% の事後確率で応募を終わらせるのは、フラグを立てた人々の無実の多数派を不利に扱うスクリーニングです。
  • メディア鑑識として。 ディープフェイク検出器は分布外で崩壊します。データセット横断のベンチマークでは、学習分布上で AUC 0.998 の検出器が、未見のデータセットで 0.674、Celeb-DF で 0.633 まで落ちます。生成器を選ぶのは攻撃側です。実際に使われている生成器に対して評価できない検出器が返すのは、数字であって統制ではありません。
  • 感情・ストレス・誠実さの推論に。 EU AI Act 第 5 条 (1)(f) は、生体データから職場における自然人の感情を推論することを禁じ、2025 年 2 月の欧州委員会の禁止慣行ガイドラインは「職場」を選考・採用中の候補者を含むものとして読んでいます。制裁金は 3,500 万ユーロまたは全世界年間売上高の 7% に達します。振る舞いからの虚偽検知はそもそも裏付けがなく、この禁止に費用は伴いません。
  • AI 利用が許可されている場合。 先にポリシーを決めて公開してください。ai_use_policy の既定値は prohibited で、回答由来クラスをオフにするのが意図的な行為になるようにしています。ただし何も公開していないなら、正直な設定値は permitted です。表明していないルールに対してスクリーニングはできません。
  • クローズ済みパイプラインへの遡及適用。 昨年の不採用者に対して実行すると、実名の個人に対する未裁定の告発ファイルができあがります。後の申立てで開示対象になり、しかも誰かを晴らすための検証ステップはもう残っていません。
  • 対面面接に対して。 本人すり替えもライブ支援も、リモートのチャネルを必要とします。オンサイトの最終ラウンドはより強い統制であり、スキルを一切必要としません。

セットアップ

  1. バンドルを配置します。 apps/web/public/artifacts/ai-interview-fraud-detection-skill/SKILL.md を、references/ とあわせてスキルディレクトリに置きます。
  2. パラメータを設定します。 references/1-signal-taxonomy.md §0 です。base_rate は直近 12 か月の自社の確定事例から取ります。事例がなければ 0.02 のままにし、事後確率はすべて上限値として読んでください。ファイルには checked: 日付と 90 日のレビュー間隔が入っています。
  3. インテークを埋めます。 references/2-interview-record-intake.md です。セクション A は発話単位のタイムスタンプを求めます。ない箇所には NO_TIMESTAMPS と書いてください。そうすればスキルは回答由来クラスを利用不可として報告し、何もない上でスコアリングすることがありません。
  4. 初回実行の前にセクション E に回答します。 同意と通知の前提条件が 5 件あり、NO が 1 つでもあれば実行は止まります。最も落ちる行は書面のカメラポリシーで、これがなければスキルはカメラ拒否について一切スコアリングしません。
  5. セクション F で検証キャパシティを確認します。 フラグは品質シグナルではなくキャパシティの数字です。月 100 ループ、事前確率 2%、偽陽性率 5% なら約 6.5 件のフラグが出て、うち実質は 1.6 件です。余裕がマイナスなら、キューが詰まってからではなく実行前にタクソノミーを絞ってください。

スキルが実際に行うこと

6 ステップです。設計を支える構造的な選択が 2 つあります。

2 パス構成で、抽出側はタクソノミーを一度も見ません。 パス 1 は主張台帳、回答ごとのレイテンシ数値、言語レジスタの記述を、不正に関する語彙を一切コンテキストに入れずに取り出します。パス 2 がそれらの事実をタクソノミーに照らしてスコアリングします。単一パスで先入観を与えると、探せと言われたものを捏造します。回避を探していると分かった瞬間、あらゆる沈黙が回避になります。分離のコストは候補者あたり 1 回の追加呼び出しです。

除外リストは出力時点で適用します。 ステップ 4 は、訛り、非母語的な言い回し、氏名の由来、自宅の背景、ウェブカメラと帯域の品質、バーチャル背景の使用、タイムゾーン単独、職歴の空白を破棄します。いずれも出身国・人種・障害・社会経済的地位と相関し、いずれも不正スクリーニングが AI スクリーニングのバイアスの申立てに変わる経路そのものです。破棄したシグナルはレポートに出力されるので、除外は前提ではなく監査可能な事実になります。

その間にあるステップ 1 は、同意が必要な生体情報について同意記録の引用がなければ実行を拒否します。声紋や顔幾何形状のエクスポートはベンダーのエクスポートに付随して届き、イリノイ州 BIPA は過失で 1 人あたり 1,000 ドル、無謀または故意で 5,000 ドルの法定損害賠償を定めています。2024 年 8 月 2 日に署名された SB 2979 はこれを 1 人・1 収集方法あたり 1 回の回収に絞り、第 7 巡回区控訴裁判所は 2026 年 4 月 1 日にこの限定が遡及適用されると判断しました。エクスポージャーは以前より小さく、ゼロではありません。分析せず、除去してください。

ステップ 5 は優先度を事後確率に変換し、事後確率×職務リスクでキューを並べます。職務リスクは職位の高さではなく初日のアクセス権です。ステップ 6 は矛盾を、面接中の該当発言と食い違う主張の両方を原文のまま出力します。読み手が結論ではなく証拠を見るためです。

コストの実際

  • 1 ループあたり — 45 分 4 ラウンドのループで、書き起こしの入力が 40〜55k トークン、参照ファイルが約 8k、2 パス合計の出力が 3〜5k です。Claude Sonnet の定価(入力 100 万トークンあたり 3 ドル、出力 15 ドル)で候補者 1 人あたり 0.20〜0.35 ドルになります。この長さの書き起こしのトークン数からの推計値です。
  • 量が出る場合 — 月 100 ループでモデル費用は 20〜35 ドルに収まります。効いてくるコストは検証ステップです。月に 6〜7 件の構造化フォローアップ 45 分に面接官の準備時間を足すと、面接官の人件費換算でおよそ 8〜10 時間です。
  • セットアップ — 90 分。この数字が正直なのは、ATS がすでにタイムスタンプ付きで書き起こしをエクスポートしている場合だけです。書き起こし取得を初めて配線するチームは 1 日以上かかり、interview intelligence のレイヤーが前提条件になります。
  • 節約できないもの — 対面ラウンドです。職務リスクが HIGH で事後確率が 20% を超える場合、出張費のほうが代替案より安く、3 つの不正クラスを一度に解消します。

成功指標

  • フラグ件数が予測レートに追随していること。 事前確率 2% が 6.5 件を予測しているのに 30 件出るなら、パイプラインが侵害されたのではなくタクソノミーの調整が狂っています。
  • すべてのフラグが結果の記録とともにクローズされていること。 references/3-verification-playbook.md §4 の意思決定ログに中間状態はありません。無関係な理由で見送った候補者に開いたままのフラグが残るのが、最悪の記録です。
  • RESOLVED の比率が 70% 超であること。 大半のフラグは検証で解消するはずです。比率が低ければ、スクリーニングがノイズで発火しています。
  • レポートに除外シグナルが 0 件であること。 一度も発火してはいけない決定論的チェックです。

代替案との比較

  • リアルタイムのディープフェイク検出ベンダーとの比較。 Pindrop、Reality Defender、および会議プラットフォームに組み込まれた検出レイヤーはメディアストリーム上で動作し、このスキルはそこを意図的に触りません。競合ではなく補完です。ただし上のデータセット横断の数字を踏まえ、評価用データセットを明言するベンダーからのみ購入してください。彼らはピクセルを検証します。回答している人物が履歴書に書いた内容を実際に知っているかは検証しません。
  • 本人確認ベンダーとの比較。 オファー段階の書類+ライブネス確認はクラス A の正しい統制であり、隣で Checkr のようなものをすでに動かしているはずです。彼らは署名した人物を検証します。2 週目以降に実際に働いている人物は検証しません。ラップトップファームの手口が生きているのはそこです。
  • プロクタリングやロックダウンブラウザとの比較。 購入は安く、運用は悪化します。面接を監視の方向に押しやり、共有回線や支援技術を使う候補者を不利にし、丁寧に行われた深掘りフォローアップ 1 回に解決量で及びません。
  • 技術評価プラットフォームとの比較。 Karat などは人間によるライブ面接を実施し、代理受験にもコパイロットにも構造的に強い方式です。予算が許すならどんなスクリーニングより強い答えです。このスキルは、自社で回すラウンドのためのものです。
  • 現状維持との比較。 訓練を受けていない人間の合成メディア検出率は偶然に近い水準です。現実の現状維持は「リクルーターが見抜く」ではなく「誰も見ない」であり、見ることの限界費用は候補者あたり 0.30 ドルです。

注意点

  • フラグが確定所見として読まれる。 ガード: すべてのフラグは入力値を併記した事後確率を出力し、不採用の根拠になる出力フィールドは存在しません。
  • 先入観を与えた抽出器による確証バイアス。 ガード: パス 1 は不正語彙をコンテキストに入れずに実行し、タクソノミーはパス 2 でのみ読み込みます。
  • 振る舞いを介した間接差別。 ガード: §4 の除外リストは出力時点で適用され、破棄したシグナルも出力されます。
  • 配慮が必要な候補者にカメラ拒否が加点される。 ガード: このシグナルは、一律に適用された書面ポリシーと提示済みの配慮経路の両方がある場合にのみスコアリングされます。なければスキルは候補者ではなくポリシーの欠落を報告します。
  • エクスポートに生体情報が同梱されてくる。 ガード: ステップ 1 は同意記録の引用がない同意必要素材の前で停止します。
  • 検証キャパシティの超過。 ガード: 月あたりの想定フラグ件数を初回実行前に出力し、キューは事後確率×職務リスクで並ぶため、待つのは裾側になります。
  • レポート自体が開示対象になる。 ガード: プレイブックの意思決定ログは各フラグを明示的にクローズし、§6 は初回フラグの後ではなく初回実行の前に候補者向け通知を公開します。

スタック

バンドルは apps/web/public/artifacts/ai-interview-fraud-detection-skill/ にあり、以下を含みます。

  • SKILL.md — スキル定義
  • references/1-signal-taxonomy.md — 重みと偽陽性推定値を持つ 4 つのシグナルクラス、除外シグナルリスト、基礎率パラメータ
  • references/2-interview-record-intake.md — フィールドごとに適法根拠の列を持つ記入式インテーク
  • references/3-verification-playbook.md — 検証手法、ライブ再検証プロトコル、意思決定ログ、候補者向け通知の雛形

実行には Claude、プロセス事実には Greenhouse のような ATS、セクション A には Metaview 相当の書き起こしソースを前提とします。

AI 面接スタックを米国の雇用 AI 規則に照らして監査すると組み合わせて使えます。あちらは記録そのものではなく、開示と設定の義務を扱います。

関連記事: 構造化面接AI スクリーニングのバイアス候補者体験リクルーティングチームの AI ポリシーinterview intelligence

Files in this artifact

Download all (.zip)