# 繁體中文長篇新聞的量測:人類側(T)與機器側對照組(M)(`ZH-NEWS-CORPUS-2026` 的 digest) > 目的:給 `references/languages/zh.md` 的中文校準補上一份繁體中文量測:人類側(T)讓台灣編輯常說的幾條 heuristic 有出現率可查,機器側對照組(M,三個模型的合成文)給同一語域的 register-to-register 比較;並記下兩側各能說什麼、不能說什麼。來源 metadata 在 [sources.md](sources.md)(`ZH-NEWS-CORPUS-2026`)。本文沒有任何原文引句;所有數字是率、比例、比值、中位數與標準差,量測輸出沒有語料規模以外的計數,例外是細讀樣本的計數(7/169 這類,樣本數不是語料數);機器側的篇數(119、每模型 40/39)與情境類型數是設計數字,不是量測輸出。 ## 一句話結論 在一份未具名台灣出版方的長篇新聞裡(約兩千篇,繁體中文,橫跨約十年,人類文本,2026-09 私下量測,語料未散布),台灣編輯圈流傳的三條「AI 味」句型,「不是…而是」、三項頓號排比、句首「其實」,分別出現在約三成、近六成、一成五的人類文章裡,所以**單一出現不是訊號**;真正接近零的是「X地」方式副詞(每十萬字 1.9)、「……」(2% 文章)、「綜上所述/總而言之」(每十萬字 0)與總結式收尾(169 篇細讀中 7 篇)。這份量測的機器側是 119 篇合成對照組(三個模型、同一份基礎提示、Grok 版多一行不讀檔案的變體、同兩天),只能做 register-to-register 的比較,不能說「什麼是機器痕跡」。 ## 語料與方法 - **語料**:一份未具名台灣出版方的長篇新聞,約兩千篇,繁體中文,橫跨約十年,人類文本。2026-09 在維護者本機量測,語料未散布,第三方無法重跑;ledger 證據等級標為 private measurement。 - **量測層**:python3 正則統計句、段、標點、引語位置與固定片語(每十萬字次數、含該形式的文章比例、篇層級中位數);jieba 0.42.1 加大詞典做詞性標注(形容詞、副詞、名物化、四字格),jieba 以簡中訓練,對繁中的詞性只看相對值。 - **細讀層**:分層抽樣 169 篇,固定欄位逐篇筆記(結構型、開頭、引語、句子、標點、敘事者、收尾、可轉成 move 的手法),引文每則不超過 20 字、每篇不超過 3 則,筆記不進 repo。 - **年代**:語料切成早期、中期、晚期三段,只用來看方向,本文不報各段篇數也不報年份。 ## 證據邊界 單一未具名出版方,一種編輯風格;人類側是真實語料,機器側是合成對照組,兩側的差異只能讀成這個語域在這三個模型、這個提示下的方向,不是 tell 的判定;jieba 對繁中詞性粗糙,形容詞與副詞密度只看相對值;開頭與收尾的啟發式分類與細讀不一致,以細讀為準;對照組不是 LLM 中文新聞的樣本,是對虛構情境的生成。 另外三點:所有比例是「含該形式的文章佔比」或「篇層級中位數」,兩者不能互換;§1b 與 §1c 每格自帶單位(每十萬字、每千 token、文章比例、篇中位、比值、細讀計數),依格讀;每十萬字的率不能換算成每篇;任何數字都不是逐段判定的門檻。人類側數字的正典分兩處:`zh.md` §1b 收錄的形式只在 §1b,§1b 未收的形式(只為對照而量的,例如數字寫法、引語長度與多句比例、引語起句、首句長、每句子句數、驚嘆號、「坦言」、「說」等)只在 §1c 的人類欄;兩處不重複。其他檔案引用時標明出處,不另立正典。 ## 量測表 正典表在 `skills/sepia/references/languages/zh.md` §1b(本表的形式)與 §1c 的人類欄(只為對照而量的形式);這裡是同一組數字加上量的種類與本機來源檔。 ### 句子與段落(篇層級中位數) | 量 | 值 | 讀法 | 本機來源 | |---|---|---|---| | 句均長 | 59 字 | 這是長句文體;長度本身不是訊號 | corpus-metrics.md `sent_mean` | | 篇內句長標準差 | 34 字 | 離散是人類特徵,與 HC3 的方向一致 | corpus-metrics.md `sent_sd` | | 三句以上近等長連串 | 每百句 2 | `style-pass.md` §5 照寫即可 | corpus-metrics.md `equal_runs_per_100_sents` | | 一個句號前最多逗號 | 9 個 | 逗號連綴長是常態,不是「一逗到底」的證據 | corpus-metrics.md `commas_before_period_max` | | 每句子句數 | 4.5 | 同上 | corpus-metrics.md `clauses_per_sent` | | 段均長 | 110 字 | | corpus-metrics.md `para_mean` | | 前五段一句段比例 | 0.4 | 單句段落當停頓是常態 | corpus-metrics.md `para_one_sent_share` | ### 標點 | 量 | 值 | 量的種類 | 讀法 | 本機來源 | |---|---|---|---|---| | 成對破折號「──…──」 | 15%;4.1 | 含該形式的文章比例;每十萬字(篇中位 0) | 比單用少一個量級,但存在;單獨出現不是離開常態,不設獵捕列 | 2026-09-16 補算(tools 目錄外一次性腳本) | | 單用「──」 | 61%;40 | 含該形式的文章比例;每十萬字 | 常態 | metrics/rare.md | | 單條「—」 | 7% | 文章比例 | 字形選擇,最多算語域不合 | metrics/rare.md | | 「……」 | 2%;0.9 | 文章比例;每十萬字 | 敘述句裡出現是離開常態;引語內是語氣 | metrics/rare.md | | 分號 | 92% | 文章比例 | 常態,政策文類最多 | metrics/rare.md | | 嵌套『』 | 52% | 文章比例 | 引號一律「」,嵌套『』 | metrics/rare.md | | 三項頓號排比(A、B、C) | 59% | 文章比例 | 常態 | metrics/rare.md | | 段末問句 | 72% | 文章比例 | 問句換段、下一段由他人接答,是可 restore 的節拍 | metrics/rare.md | ### 固定片語(每十萬字;含該片語的文章比例) | 片語 | 每十萬字 | 文章比例 | 讀法 | 本機來源 | |---|---|---|---|---| | 綜上所述 | 0 | 0% | 語域不用 | metrics/rare.md | | 總而言之/總的來說 | 0 | 0% | 語域不用 | metrics/rare.md | | 值得一提的是 | 0.1 | 1% | 語域幾乎不用 | metrics/rare.md | | 值得注意的是 | 0.6 | 4% | 少見 | metrics/rare.md | | 不是…而是 | 6.3 | 30% | 單一出現是常態 | metrics/rare.md | | 句首「其實」 | 2.8 | 15% | 常態 | metrics/rare.md | | 此外 | 9.4 | 37% | 單用是常態;跨子句串接仍走 `zh.md` §2 | metrics/rare.md | | 然而 | 18 | 53% | 同上 | metrics/rare.md | | 坦言 | 4.6 | 21% | 新聞腔的 attribution 動詞,評論組接近零;但機器側三個模型每十萬字都是人類的 2–7 倍(`zh.md` §1c),不列為 restore 對象 | metrics/rare.md | | 直言 | 3.1 | 16% | 同為新聞腔 attribution 動詞,評論組接近零;機器側未量測,restore 與否由 venue 決定 | metrics/rare.md | ### 字詞(jieba 詞性,相對值) | 量 | 值 | 讀法 | 本機來源 | |---|---|---|---| | 「X地」方式副詞接動詞 | 每十萬字 1.9 | 這個語域幾乎不用;出現即離開常態,但這不是機器側量測 | lexicon.md | | 「很」:「非常」 | 約 11:1 | 「非常/十分/極為」堆疊才是離開常態 | lexicon.md | | 帶「○○性/○○化/○○感」後綴的詞 | 每十萬字 77 | 純詞彙計數,多為法律政策固定詞;沒有量這些詞是否當主語或包住動詞(「自我的探索」),名物化主語本身未量測 | lexicon.md | | 「的」三連 | 每十萬字 9.8 | 比評論組少一半;新聞編輯會砍 | lexicon.md | | 四字格 | 每千 token 2.1 | 多是邏輯連接(在此之前、如此一來),不是成語妝點 | lexicon.md | | hedge 詞 | 每十萬字 130 | 八成是「可能」 | lexicon.md | | 情緒:體感詞 vs 命名詞 | 13.1 vs 5.0 每十萬字 | 情緒靠動作與身體,不靠形容詞;與 StoryScope 對小說的觀察方向相反,文類決定 | lexicon.md | ### 引語(篇層級中位數) | 量 | 值 | 讀法 | 本機來源 | |---|---|---|---| | 含任何「」的句子沒有 attribution 動詞(含術語與反諷引號) | 61% | 這個語域多數「」是術語不是說話,此列不能推論說話引語的 attribution | corpus-metrics.md `q_sentence_no_attrib_share` | | 含 15 字以上「」引語的句子沒有 attribution 動詞 | 33%(q1 20%、q3 50%) | 長度是代理,不是說話分類:標題、口號、書面聲明都還在池子裡;說話引語本身未量測,此列不支持任何 restore 規則 | 2026-09-16 補算(一次性腳本) | | `:「` 冒號導入 | 6%(全部「」引語);10%(q1 0%、q3 22%;15 字以上引語) | 量的是一般引號「」,不是嵌套『』;冒號導入存在但是少數 | corpus-metrics.md `q_colon_lead_share`;15 字以上為 2026-09-16 補算 | | 引語每千字 | 6.5 段 | | corpus-metrics.md `quotes_per_1k` | | 引語中位長度 | 8 字 | 多數「引號」是術語或反諷的「所謂」式引號,不是說話 | quotes.md | | 引語收段 | 14% | 引語收段後不補評論句 | corpus-metrics.md `quote_ends_para_share` | ### 結構(169 篇細讀) | 量 | 值 | 讀法 | 本機來源 | |---|---|---|---| | 混合型 | 98/169 | 沒有單一模板 | notes-summary.md | | 總結式收尾 | 7/169 | 引語 47、資訊 37、呼籲 29、回到人物 20、懸置 19;總結是最少的 | notes-summary.md | | 整篇三段排比結構 | 141/169 標「無」 | 頓號三連是句內常態,整篇三段結構才少見 | notes-summary.md | | 等長句連串 | 149/169 標「無」 | 與量測一致 | notes-summary.md | ## 對 Sepia 的推論(標「推論」,非量測所述) 1. **推論**:台灣編輯 heuristic 的三條句型在人類新聞裡出現率高,`zh.md` §4 應從「未量測」改為「人類側有出現率;單一出現是常態,叢集才走 §2 模板」。 2. **推論**:「X地」方式副詞只在新聞語域列入 §2 獵捕;小說對白、技術與事故文件裡的「緩緩地說」不在這份量測的範圍內,T 對其他語域什麼都沒說。 3. **推論**:引語收段不補評論是可 restore 的新聞寫法(細讀 47/169 引語收尾);說話引語的 attribution 未量測(引語列只有長度代理),不從 T 推 restore。 4. **推論**:句長、逗號連綴、破折號單用、分號、「此外/然而」單用,都不是訊號,應寫進 §5。 5. **推論**:總結式收尾在這個語域接近零,與 `professional-pass.md` check 7 的方向一致。 6. **推論**:以上五點的 venue 版本寫進 `skills/sepia/references/domains/journalism.md`(長篇新聞 domain),每列 Evidence 欄標明是人類側量測、細讀計數,或尚未量測。 ## 機器側對照組(2026-09-16/17) **設計**:40 個虛構情境(場景 9、人物 7、政策 7、數據 6、調查 6、即時 5),人物、地點、機構、數字全部虛構;一個中性提示(記者身分、1,000–1,400 字、至少三則直接引語、不要 Markdown,沒有任何風格或去 AI 指令;Grok 版多一行「不要讀取檔案或 skill」,因為前兩次它把唯一一輪拿去讀內建 skill);三個模型各在沒有任何 skill、plugin、rules、記憶的環境下 headless 產生:Grok 4.6(乾淨 HOME)、GPT-6(乾淨 CODEX_HOME)、Gemini 3.8 Flash(`--model gemini-3.8-flash-high`;先用 CLI 預設的 Gemini 3.1 Pro 跑過一組,使用者指定改用 3.8 Flash 後封存)。Grok 與 GPT-6 各 40 篇,Gemini 39 篇(一個情境兩次都回空)。用與人類側相同的量測腳本(`--dir`)。正典表在 `zh.md` §1c,這裡只列方向與讀法。 **三個模型一致且差距大**:句子短五分之一到四成(均 34–48 對 59 字),篇內離散度約一半(SD 15–19 對 34),每句子句少四分之一到三分之一(3.1–3.4 對 4.5;一句號前逗號的篇內最大值 4–5 對 9 受篇長影響,人類篇長數倍,未做長度配對,只列弱表),60 字以上句子的比例 5–23% 對 42%;數字全寫中文(阿拉伯數字每千 token 0 對 18.7);首句短、前 80 字不含阿拉伯數字(未計國字數字,機器側數字全寫國字,所以不能說首段沒有數字);引語中位長 3–6 倍、多句引語 4–7 倍、引語起句比例高(提示本身要求至少三則引語,會放大這組);「不是…而是」每十萬字 2.9–7.5 倍;「坦言」2–7 倍;驚嘆號 0(人類 54% 文章有,幾乎全在引語內);破折號幾乎不用,成對插入語 0–2% 對 15%,「英文 em dash 習慣移植」的假設在這裡不成立。 **模型各異或弱**:「此外」「然而」依模型不同;「表示」GPT-6 一家翻倍、其餘相近;段末問句無方向(GPT-6 每十萬字高於人類、文章比例低於人類,Grok 為 0);情緒詞只有 Gemini 偏高;名物化後綴的篇中位在短篇上全為 0,是長度造成的假象,不採用;「其實」與頓號三連計數太少;小標比例是「≤25 字且無句末標點的段落」這個代理,提示禁用 Markdown,是否為小標未判定。 **HC3 的兩個方向**:離散度方向一致(人類篇內 SD 大);平均句長方向相反(HC3 的 ChatGPT 在字數單位下略長,這裡三個模型都短)。語域與模型世代都不同,兩個數字都不是長度目標。 **限制**(原樣寫進 `zh.md` §6 與 ledger):每模型約 40 篇、約 1,400 字,對上人類每篇數千字;一個基礎提示版本(Grok 版多一行不讀檔案或 skill 的指示,是跨模型的一個混淆源),且提示本身限了長度與引語數;虛構情境,沒有真實採訪事實;三個模型、同兩天、預設設定;短篇的篇中位比人類側更吵;沒有人類寫同一批情境,所以是 register-to-register 不是 brief-to-brief。不是分類器,不是偵測宣稱。 **規範側**:教育部《重訂標點符號手冊》修訂版(`MOE-PUNCT-2008`)規定「」『』先單後雙、引文句尾符號在引號內、「──」佔行中二格、「……」六點佔行中二格、夾注號甲式( )乙式── ──;行政院《公文書橫式書寫數字使用原則》(`EY-NUMERALS-2004`)規定統計、日期、時間、序數、計量用阿拉伯數字,描述性用語、專有名詞、慣用語用中文數字。量測到的人類側:阿拉伯數字為主(總量分布,未標語意類別,不做與數字原則的一致性判定);單用「──」常見,61% 文章有;「……」極少,2% 文章,兩者與標點手冊的形式相符;機器側全寫中文數字,是總量分布上的差異;本量測沒有標註每個數字的語意類別(統計、日期、序數、慣用語),不能據此說它違反該原則。詳見 `research/newswriting-guides.md`。 ## 不進 skill 的東西與原因 - 敘事結構型態清單與引語處理手冊:整份放進去等於 house style 手冊,那本身是指紋;只抽上面的數字進 §1b 與 §1c 的人類欄;機器側的數字進 §1c 的三個模型欄。 - 記者層級的風格卡:單一出版方、附篇數與年代,圈內人可反推;只保留一句聚合觀察——多數個別記者的量測指標與全集差距不到 0.75 個四分位距,房子風格壓過個人風格。 - 細讀筆記與任何原文引句:不進 repo。 - 任何門檻:上面的數字都是描述,不是逐段判定線。