# 比較検証ベンチマーク 本ドキュメントは、LLMが生成する素の文章(LLM-Slop)、人間が執筆した元文章(オープンライセンス)、および `yomiyasu` スキル適用後のリライト文章の3者を比較検証した記録です。 GitHub上で公開・再配布できるよう、元文章にはCC BY 4.0互換(政府標準利用規約2.0)およびパブリックドメイン(CC0相当)のテキストを採用しています。 --- ## 比較検証セット A: 業務・仕様解説(デザインシステム導入と運用) ### 1. 人間が書いた元文章 - 出典: デジタル庁「ウェブアクセシビリティ導入ガイドブック」(政府標準利用規約2.0 / CC BY 4.0互換)をもとに検証用として一部を抜粋・要約 - ライセンス表示: 本節の引用文は上記資料に基づいています。 > 画面デザインの作業において、従来は全部のパーツをそれぞれいちから作らないといけなかったが、デザインシステムに含まれるコンポーネントを選択して編集して作ることができる。パーツ作成よりも重要な、画面に必要なパーツは何かという画面設計のほうに多くの工数を割けるようになる。 > 画面自体や画面遷移をプログラム開発する際に、コンポーネントの仕様が明確になっていることでコードを記述しやすくなる。 > デザインシステムを活用しても、デザイン作業がなくなったり、デザイナーの配属が不要になったりすることはありません。しかし、デザイン作業を効率化して比重をかけるべき作業内容に多くの工数をかけられるようになります。すなわちデザインシステムを活用することでデザインの品質を高めることができ、またアクセシビリティの確保も進むため最終的な成果物の品質も向上します。結果として、デザインシステムを業務で活用することは、ユーザーにより良い体験を提供することに繋がります。 --- ### 2. 素のLLMが生成した文章(スキル未適用) 同内容を一般的なLLMに「業務ドキュメントとしてわかりやすく解説して」と指示した際の出力例です。 > ここで**重要なのは、単なるパーツの共通化ではなく、組織の意思決定OSとしてのガバナンス**です。 > > 従来の開発では、画面ごとに手触り感を探りながらパーツを作っていました。しかし、片方だけを見て画面を作ると、もう片方のアクセシビリティが**静かに壊れます**。そこでデザインシステムという**強固な土台**を置くことで、開発者の**解像度が一段上がります**。 > > デザインシステム導入のメリットは、主に次の3点です。 > > - **開発速度の加速**: コンポーネントを再利用することで、時間を溶かさずに済みます。 > - **仕様の収斂**: 判断に迷うスタイルは、あらかじめ**共通側に倒します**。 > - **アクセシビリティの担保**: ガイドラインが規律を要求するため、事故を未然に防ぐことができます。 > > もちろん、これは「デザイナーが不要になる」ことを意味しません。本質的なのは、作業の泥臭さを減らし、ユーザー体験という核心に向き合うことです。この線引きが、日々の開発に**地味に効いてきます**。ぜひ参考にしてみてください! --- ### 3. `yomiyasu` 適用後の文章 素のLLM出力を `yomiyasu` スキルでリライトした結果を次に示します。 > デザインシステムを導入する目的は、ボタンや入力欄などのUIパーツを一から作成する負担を減らし、画面全体の情報設計に集中することにあります。 > > 各コンポーネントの見た目やアクセシビリティ要件があらかじめ定義されていれば、デザイナーと開発者はコードの記述や画面遷移の実装を円滑に進められます。スタイルの指定に迷った場合でも、定義済みの標準コンポーネントを選択すれば表示の不整合を防ぐことが可能です。 > > 導入によってデザイン作業そのものが不要になるわけではありません。しかし、単純なパーツ作成にかかる工数を削減することで、本来注力すべき使い勝手の検証や品質向上に時間を充てられるようになります。結果として、利用者が迷わず操作できる高品質な行政サービスの提供につながります。 --- ### セットAの静的リンター(`yomiyasu_lint.py`)測定比較 ※ 引用符(`>`)を除外した本文テキストを `yomiyasu_lint.py` で機械計測した実測値です。 | 指標 | 人間の元文章 | 素のLLM文章 | `yomiyasu` 適用後 | |---|---|---|---| | **総合スコア** | **95 / 100** | **33 / 100** | **100 / 100** | | **判定** | 文末重複1件(※1) | 重大なAI臭(14件) | 指摘なし(合格) | | **太字頻度 (1,000字あたり)** | 0.0 個 | 20.1 個(警告基準3.0超) | 0.0 個(適正) | | **箇条書き比率** | 0.0% | 42.9%(警告基準25%超) | 0.0%(地の文で論述) | | **非生物主語・比喩動詞** | なし | 「静かに壊れる」「倒す」「効く」「溶かす」 | なし(直接動作へ変換) | | **否定対比** | なし | 「単なる共通化ではなく〜」 | なし(直接肯定) | ※1: 原文末尾において「〜向上します」「〜繋がります」等の同一文末が3連続したため、形式的な文末重複ルールにより-5点となっています。比喩やスロップ語彙の混入はありません。 --- ## 比較検証セット B: 技術記事(分散システム・非同期処理のエラーハンドリング) ### 1. 人間が書いた元文章 - 出典: 検証用に作成した分散キュー設計メモ(パブリックドメイン / CC0相当) > 非同期キューを用いたメッセージ処理では、ネットワーク断やコンテナ再起動によって処理が途中で失敗する可能性がある。このため、コンシューマー側は同一メッセージが複数回配送されても正しく動作するように冪等性を保証しなければならない。 > > 具体的には、メッセージに含まれるユニークIDをデータベースのユニーク制約付きテーブルへ記録し、すでに処理済みのメッセージであればスキップする。また、外部APIへのリクエストが失敗した場合は、指数バックオフを伴うリトライを行い、一定回数以上失敗したものはデッドレターキュー(DLQ)へ退避して手動調査を行う設計が基本となる。 --- ### 2. 素のLLMが生成した文章(スキル未適用) 同内容を一般的なLLMに「技術記事として書いて」と指示した際の出力例です。 > 非同期処理における**最大の落とし穴**は、ネットワークの瞬断です。 > > **依存構造は分割できない。動かしながら引き返す。** > > 単にメッセージを流すだけでは、背後でデータが**静かに壊れます**。前提を、経路が代わりに添えてくれるわけではありません。 > > そこで**地味に効いてくる**のが、以下の3つの原則です。 > > - **冪等性の担保**: ユニークIDを照合し、重複した処理は**黙ってスキップ**します。 > - **安全なリトライ**: 指数バックオフを挟むことで、DBの負荷を逃がします。 > - **DLQへの退避**: 破綻したメッセージは隔離し、原因を1つずつ**潰していきます**。 > > デバッグで丸一日**時間を溶かさない**ためにも、この境界線を意識した設計が不可欠です。いかがでしたでしょうか。 --- ### 3. `yomiyasu` 適用後の文章 > 非同期キューを用いたメッセージ処理では、通信の切断やサーバーの再起動によって処理が中断されるおそれがあります。メッセージの二重送信が発生しても不整合を起こさないよう、受信側のプログラムで冪等性を担保する設計が不可欠です。 > > 具体的な対策として、メッセージの固有IDをデータベースに記録し、同一IDをすでに処理済みであれば追加処理を行わずに終了します。外部APIの呼び出しに失敗した場合は、待機時間を徐々に延ばしながら再試行し、規定回数を超えて失敗したデータはデッドレターキュー(DLQ)へ退避して手動調査に回す構成をとります。エラー時の復旧手順をあらかじめ決めておけば、障害発生時にも迅速な原因究明が可能です。 --- ### セットBの静的リンター(`yomiyasu_lint.py`)測定比較 ※ 引用符(`>`)を除外した本文テキストを `yomiyasu_lint.py` で機械計測した実測値の記録です。 | 指標 | 人間の元文章 | 素のLLM文章 | `yomiyasu` 適用後 | |---|---|---|---| | **総合スコア** | **100 / 100** | **65 / 100** | **100 / 100** | | **判定** | 指摘なし(合格) | AI臭の検出(7件) | 指摘なし(合格) | | **太字頻度 (1,000字あたり)** | 0.0 個 | 29.7 個(警告基準3.0超) | 0.0 個(適正) | | **箇条書き比率** | 0.0% | 37.5%(警告基準25%超) | 0.0%(地の文で論述) | | **比喩動詞・構文** | なし | 「静かに壊れる」「黙って」「効く」「溶かす」「潰す」 | なし(客観的動作へ変換) | | **非生物主語** | なし | 「依存構造は分割できない」「前提を経路が添える」 | プログラム・運用者を主語に復元 | | **定型結び** | なし | 「いかがでしたでしょうか」 | 削除 | --- ## 4. 考察 1. 人間の元文章の特徴 不要な修辞を交えず、主語・条件・対象・結果を淡々と記述しており、実質的な情報密度の高さが際立ちます。 2. 素のLLM文章の傾向 太字や箇条書きで強調を図る一方、英語直訳調の比喩動詞や非生物主語が多く、文章量に対して具体的な手順や仕様が薄くなる傾向が見られました。 3. `yomiyasu` による調整効果 主語・目的語・動詞の関係を再構築し、比喩を客観的表現へ戻すことで、リンターの機械的減点を解消できる事実を確認しました。なお、本ベンチマークは特定の検証ケースにおける静的メトリクスの推移を示すものであり、あらゆるLLMや文章における読みやすさ・正確性を保証するものではありません。実務での運用時は文脈に応じた人間の最終確認を推奨します。