方法論

方法論

このサイトの構築方法、ソースの取り扱い、データ品質の維持方法。すべての主張は公式文書にリンクしています。

サイトの仕組み

偽りの対応表や隠れた出典レイヤーはありません。

データパイプライン

正確性とトレーサビリティを確保するため、厳密なデータパイプラインに従っています:

  1. ソース取得 — 総務省と e-Stat から公式 PDF 文書および構造化データファイルをダウンロード。サードパーティデータソースは使用しません。
  2. 抽出 — ビルドスクリプトが公式 PDF と JSON ファイルを解析し、JSIC の完全な階層(20大分類、73中分類、281小分類、786細分類)を抽出。
  3. 検証 — 抽出されたすべてのコードは公式構造に対して検証。親子関係を確認し、欠落や孤立したコードはフラグ付け。
  4. エンリッチメント — 公式注釈(概要、例示、除外、注記)を各コードにリンク。ISIC、NACE、NAICS への対応表を適用。
  5. 生成 — ビルドスクリプトがすべてのコード、セクション、分類レベルの静的 HTML ページを生成。各ページには出典参照と階層ナビゲーションを含む。

ソース検証

このサイトのすべてのデータは公式ソースにトレース可能です:

  • 一次ソース — 総務省が JSIC Rev. 14 の公式文書を公開。これらが権威ある参照です。
  • 構造化データ — e-Stat がプログラムアクセスに使用する機械可読形式の分類階層を提供。
  • クロスリファレンス — 国際分類(ISIC Rev.4、NACE Rev.2、NAICS 2022)は各公式機関(国連、ユーロスタット、米国 OMB)から参照。
  • データ捏造なし — 公式データに対応表やマッピングが存在しない場合、このサイトでは作成しません。

ソースページで公式文書への直接リンクをご覧ください。

翻訳の方針

  • 公式翻訳を優先 — 日本政府が公式な英語 Equivalent を公開している場合は、それを使用。
  • 直接翻訳 — 公式英語名がない場合、日本語テキストから直接翻訳し、技術的意味を保持。
  • 一貫性 — 関連するコードで一貫した用語を使用(例:「大分類」→「Section」、「中分類」→「Major group」)。
  • 解釈なし — 翻訳は日本語の文字通りの意味を反映。編集的解釈は避ける。

リスクスコアの方法論

各産業コードは、7つの決定論的要因に基づいて0〜10のコンプライアンスリスクスコアを受けます。スコアはデータカバレッジを反映し、ビジネスリスクを反映するものではありません。

詳細な数式、要因の説明、実装の詳細はリスクスコア方法論ページをご覧ください。

品質保証

ビルド時に以下のチェックが実行されます:

  • 階層整合性 — すべてのコードは有効な親チェーン(セクション → 中分類 → 小分類 → 細分類)を持つ必要があります。
  • 重複検出 — 同じ階層レベルでの同一コードはフラグ付け。
  • 対応表検証 — マッピングされたコードはソースとターゲットの両方の分類に存在する必要があります。
  • リンク検証 — 内部リンクは正しいルートか確認。公式ソースへの外部リンクも検証。
  • ページ生成 — ビルドプロセスが786以上の静的ページを生成。テンプレートエラーやデータ欠落があるとビルドは失敗。

構築技術

  • フレームワークAstro 静的サイト生成。
  • データ形式 — 階層、対応表、メタデータ用の JSON ファイル。
  • ビルドスクリプト — データ抽出、検証、ページ生成用の Node.js スクリプト。
  • ホスティング — CDN 経由で提供される静的ファイル。サーバーサイド処理なし。
  • 分析 — Google Analytics(GA4)による利用統計のみ。個人データの収集なし。

制限事項

  • このサイトは JSIC Rev. 14 のみをカバー。過去の改定は参照用に掲載していますが、完全には閲覧できません。
  • 対応表はセクションレベルのみ。JSIC と他の分類間の詳細な4桁対4桁マッピングは公式データに含まれていません。
  • 英語翻訳は最善を尽くしていますが、規制目的では公式の日本語文書をご参照ください。
  • リスクスコアはデータカバレッジを反映し、コンプライアンス助言ではありません。ビジネス判断の唯一の根拠として使用しないでください。

お問い合わせ

方法論、データソース、技術実装に関するご質問はお問い合わせページをご利用ください。