公開test候補 / 明示承認前は未公開

「最強AI」ではなく、
日本語の実作業で選ぶ。

同じ合成レシート20件を、同じgoldとfield graderで繰り返し測るためのbenchmark。感想ではなく、入力・失敗・採点根拠・versionを残す。

合成入力 20件個人data 0件自動採点 100%外部製品比較 未実施
20/20
rights/provenance記録
100%
deterministic field scoring
5分
1結果の差替え見積り
UNKNOWN
traffic / conversion / 売上

誰の、どの検索に答えるか

検索意図仮説

ChatGPT Gemini Claude 比較 日本語

一般benchmarkの順位ではなく、日本語の具体的入力でどこが壊れるかを購入前に確認する

入口: 同じ20レシートを全製品へ投入した失敗例とfield単位score

検索量: 未取得

検索意図仮説

AI レシート OCR 精度 比較

総合OCR精度でなく日付・税率・明細・合計のどのfieldが失敗するかを確認する

入口: 権利明確な日本語receipt、gold JSON、field score、controlled error

検索量: 未取得

検索意図仮説

生成AI 仕事 用途別 どれ

機能表でなく再現可能な仕事単位の比較から候補を絞る

入口: workflow別の固定dataset、version履歴、再実行日、費用時点

検索量: 未取得

競合sampleと未充足仮説

入口確認したoffergap仮説証拠範囲
AIコンパス LLMベンチマーク比較2026MMLU、HumanEval、GPQA、SWE-bench、JGLUEの横並びと用途別champion一般benchmark中心で、日本語レシート入力、gold、field failureの再現packageは確認できない。page_opened
生成AI比較 LLMリーダーボード主要modelの日本語leaderboardと更新時点を掲示model specと順位の代替であり、実作業assetの有無は追加確認が必要。search_result_only
4大AIツール徹底比較 2026年版ChatGPT、Claude、Gemini、Copilotの機能と同一お題の体験比較動画体験談は入口競合だが、download可能なgoldと再採点履歴は確認できない。search_result_metadata
ChatGPT・Claude・Gemini 本音比較3 serviceを用途別に使い分ける体験比較視聴需要のproxyにはなるが、検索量、conversion、再現可能scoreの証拠ではない。search_result_metadata
TechRadar best AI tools 2026多数のAI toolを編集者の試用経験と用途別長短で比較大手mediaの編集信用とdomain authorityは強い。日本語workflow一次dataで差別化してもtraffic優位は未証明。search_result_excerpt

このpageが証明すること/しないこと

証明済み

  • 20件の合成receiptとgoldを固定できる
  • field単位graderを再実行できる
  • rights、version、hashを保存できる

未検証

  • 実画像OCRと外部AI製品の優劣
  • 検索量、順位、click、repeat
  • 支払意思、affiliate eligibility、収益
Fail closed: 未観測値を0や推定実績に置き換えない。公開後の測定gateを通るまで、このpageはdistribution成功を主張しない。

画像layout sample(合成・権利確認済み)

実在の購入履歴・販売者・個人情報は含まない。5 layoutはasset packageの成立例であり、OCR精度の主張ではない。

合成レシート plain layout
plain
合成レシート boxed layout
boxed
合成レシート narrow layout
narrow
合成レシート two-column layout
two-column
合成レシート rotated layout
rotated