20/20
rights/provenance記録
同じ合成レシート20件を、同じgoldとfield graderで繰り返し測るためのbenchmark。感想ではなく、入力・失敗・採点根拠・versionを残す。
一般benchmarkの順位ではなく、日本語の具体的入力でどこが壊れるかを購入前に確認する
入口: 同じ20レシートを全製品へ投入した失敗例とfield単位score
検索量: 未取得
総合OCR精度でなく日付・税率・明細・合計のどのfieldが失敗するかを確認する
入口: 権利明確な日本語receipt、gold JSON、field score、controlled error
検索量: 未取得
機能表でなく再現可能な仕事単位の比較から候補を絞る
入口: workflow別の固定dataset、version履歴、再実行日、費用時点
検索量: 未取得
| 入口 | 確認したoffer | gap仮説 | 証拠範囲 |
|---|---|---|---|
| AIコンパス LLMベンチマーク比較2026 | MMLU、HumanEval、GPQA、SWE-bench、JGLUEの横並びと用途別champion | 一般benchmark中心で、日本語レシート入力、gold、field failureの再現packageは確認できない。 | page_opened |
| 生成AI比較 LLMリーダーボード | 主要modelの日本語leaderboardと更新時点を掲示 | model specと順位の代替であり、実作業assetの有無は追加確認が必要。 | search_result_only |
| 4大AIツール徹底比較 2026年版 | ChatGPT、Claude、Gemini、Copilotの機能と同一お題の体験比較 | 動画体験談は入口競合だが、download可能なgoldと再採点履歴は確認できない。 | search_result_metadata |
| ChatGPT・Claude・Gemini 本音比較 | 3 serviceを用途別に使い分ける体験比較 | 視聴需要のproxyにはなるが、検索量、conversion、再現可能scoreの証拠ではない。 | search_result_metadata |
| TechRadar best AI tools 2026 | 多数のAI toolを編集者の試用経験と用途別長短で比較 | 大手mediaの編集信用とdomain authorityは強い。日本語workflow一次dataで差別化してもtraffic優位は未証明。 | search_result_excerpt |
実在の購入履歴・販売者・個人情報は含まない。5 layoutはasset packageの成立例であり、OCR精度の主張ではない。




