# 節奏與句法研究摘要(sentence rhythm、標點、分段、中文校準的 evidence base) 來源:`sources.md` 的 "Syntax, rhythm, punctuation" 節(16 篇量測研究)與 "Consulted with no usable numbers" 子表。調查日期 2026-09-04。本檔是研究 metadata,skill 執行期不需要它;skill 檔只引用其中標明「已量測」的方向與數字,處方一律標為 Sepia 推論。 ## 一句話結論 **只有「句長離散度」站得住**:人類文本的句長變化幅度大於 LLM,這個方向在四篇量測文內離散或尾端分布的研究(Desaire、Gude、Muñoz-Ortiz、朱君輝)、兩個模型世代、英文和中文語料都一致;另外三篇英文研究只量到跨篇均值的離散,方向相同但不能作為文內檢查的依據。句長的**平均值**隨模型世代反轉,標點密度在不同量法之間方向相反,段落長度與段落數在不同語料之間互相矛盾。因此 sepia 只新增一條句長節奏檢查,把標點計數與段落長度明列為非訊號,並為中文另立校準檔。 ## 方法(可信度依據) | 研究 | 語料與模型 | 人類基線 | 讀取程度 | |---|---|---|---| | `DESAIRE-2023` | *Science* Perspectives 段落 vs 2023 年 3 月 ChatGPT(GPT-3.5 世代);20 個手工特徵,XGBoost | 期刊科學作者 | 全文(arXiv PDF) | | `GUDE-2026` | NYT 導言段;2023 base 模型(LLaMA 7B–65B、Falcon 7B、Mistral 7B)與 2025 對齊模型(Qwen 2.5 14B–72B、LLaMA 3.3 70B、Mistral 7B v0.3、GPT-4o);prompt 限「兩三句」 | NYT 記者 | 全文(arXiv HTML v1,Table 7) | | `MUNOZ-ORTIZ-2024` | 同一批 NYT 導言段;六個 2023 base 模型 | NYT 記者 | 全文(PMC;句長分布只在圖中,分箱句數可重建) | | `ZAMARAEVA-2025` | 同一批 NYT 語料,ERG(HPSG)全句剖析 | NYT 記者 | 全文(arXiv HTML;ACL 2025 出處於 Anthology 核實) | | `HERBOLD-2023` | 270 篇英文論說文;ChatGPT-3.5 與 GPT-4(2023-03) | 非母語高中生 | 全文(PMC) | | `ZINDELA-2023` | 20+20 篇論說文;ChatGPT-3.5 | 南非 L2 大學生 | 全文(ERIC PDF) | | `LIU-LIU-2025` | 73+73 篇論說文;GPT-4o mini | ICNALE 美國大學生 | 全文(PMC) | | `PRZYSTALSKI-2025` | Wikipedia 詞條摘要 vs GPT-3.5/GPT-4/Llama/Orca/Falcon 十句短文 | Wikipedia 編者 | arXiv HTML(Table 2) | | `ZHU-CCL-2023` | HC3-Chinese 開放域問答 6,586+6,586 篇;GPT-3.5 世代 ChatGPT;159 項中文 CTAP 特徵 | 簡體中文問答者 | 全文 | | `GUO-HC3-2023` | HC3 中英問答語料原始論文 | 同上 | 全文 | | `JIANG-CCL-2025` | 200 則「弱智吧」笑話;GPT-4o、DeepSeek-R1、Qwen2.5-7B、Qwen3-235B | 貼吧使用者 | 全文 | | `FREEBURG-2026` | 12 個模型的英文論說文約 24 萬字;破折號每千字計數 | **僅 8 篇**已出版論說文 | 全文(arXiv HTML,未經同儕審查) | | `GODGHASE-2024` | WikiHow 段落 78 萬 vs ChatGPT 92 萬段 | WikiHow 作者 | 全文(PDF,未經同儕審查) | | `LLM-REVAL-2025` | 人類 vs LLM 撰寫的論文,段落平均長度 | 論文作者 | 搜尋摘要核對數字 | | `PUDASAINI-2026` | PAN CLEF 2025、COLING 2025 偵測基準;SHAP 特徵重要度 | 基準資料集 | 全文(HTML) | | `KATFISH-2025` | 韓文論說文、詩、論文;逗號與連接語尾 | 韓文作者 | 摘要與片段 | 以下數字均按原文單位轉錄;未在原文印出的值(例如 Desaire 的 SD 實際數值、Muñoz-Ortiz 的句長均值)不補、不推估。 ## 已量測的方向(可轉成規則的部分) ### 句長離散度:人類 > LLM,方向一致 | 量測 | 人類 | LLM | 來源與單位 | |---|---|---|---| | 段內句長標準差、相鄰句長差 | 較大 | 較小 | `DESAIRE-2023` Table 1 特徵 8–9,方向「Human」,數值未印出 | | 短句(<11 詞)與長句(>34 詞)出現 | 較多 | 較少 | `DESAIRE-2023` 特徵 10–11 | | 1–15 token 短句占比 | 32–33% | 2023 base 35–39%;**2025 對齊模型 1–4%** | `GUDE-2026` Table 7;原文「reduce short sentences by factors of 9 to 30」 | | ≥41 token 長句占比 | 12.0% | 5.5%(LLaMA-7B) | `MUNOZ-ORTIZ-2024` Table 4 分箱句數重建,非原文印出 | | 跨篇「每篇平均句長」的 SD | 11.32 | 2.19 | `ZINDELA-2023` Table 3,詞;均值 24.44 vs 23.23 | | 同上 | 9.374 | 4.836 | `LIU-LIU-2025` 論點段,詞;均值 21.944 vs 20.847(p = .867) | | 同上 | 5.5 | 2.6 | `PRZYSTALSKI-2025` Table 2,token;均值 24.0 vs 22.3 | | 句長標準差(詞例) | 9.248 | 6.729 | `ZHU-CCL-2023` 表 2,HC3-zh | | 句長標準差(字例) | 15.150 | 12.842 | 同上 | 注意三篇印出 SD 的英文研究量的都是「跨篇每篇均值的 SD」,不是文內逐句 SD;**沒有任何可取得的同儕審查論文印出英文文內句長 SD 的人機數值**。Desaire 是唯一以段內 SD 為特徵的同儕審查研究,但只給方向。 ### 句長平均值:隨模型世代反轉,不能寫目標值 | 世代 | 人類 | LLM | 來源 | |---|---|---|---| | 2023 base(LLaMA、Falcon、Mistral) | 22.33 token | 18.17–19.42(短 10–20%) | `GUDE-2026` Table 7 | | 2025 對齊(Qwen 2.5、LLaMA 3.3、Mistral v0.3、GPT-4o) | 22.19 token | 25.63–29.87(長 15–30%) | 同上 | | ChatGPT-3.5/4 vs L2 學生 | 18.60 | 20.31/19.57 | `HERBOLD-2023` | | GPT-4 Turbo vs L2 學生(T-unit) | 23.61 | 15.91 | Fredrick 2025(consulted 表) | | HC3-zh,詞 | 25.067 | 21.823 | `ZHU-CCL-2023` | | HC3-zh,字 | 40.893 | 42.396 | 同上 | 同一語料換單位(詞/字)方向就翻轉,換人類基線也翻轉。這是「不寫絕對句長門檻」的直接依據。 ### 句法配方(已在 `style-pass.md` §2 的部分,本次只補數字來源) `REINHART-STYLE-2025`(GPT-4o):現在分詞子句 5.3×(d = 1.38)、名物化 2.1×(d = 1.23)、短語並列 1.9×、that 子句主語 2.6×、無施事被動 0.5×;base Llama 3 接近人類,指令微調是主因。`HERBOLD-2023`:名物化每句 1.06 → 1.56/1.73;情態詞每篇 10.84 → 8.97/6.12;認知標記每句 0.06 → 0.02/0.00;話語標記 0.57 → 0.52/0.36。`ZAMARAEVA-2025`:構式 Shannon H 人類 3.342 vs LLM 3.221–3.284(p < 0.01);LLM 彼此 cosine 0.9966–0.9999,人類–LLM 0.9950–0.9965,約等於 NYT–WSJ 的體裁差。`MUNOZ-ORTIZ-2024`:依存距離在同句長分箱幾乎相等(2.37 vs 2.36–2.39),差在成分長度(LLM 每個分箱都較長:4.32/6.37/7.90 vs 約 4.40/6.55/8.30)。 ### 中文(HC3-zh,`ZHU-CCL-2023` 表 2–5,每篇回答均值;`GUO-HC3-2023` 補充) | 特徵 | 人類 | ChatGPT | 備註 | |---|---|---|---| | 語氣詞密度 | 0.016 | 0.003 | 人類 5 倍 | | 連詞密度 | 0.013 | 0.036 | 「和」每篇 4.13 vs 11.76 | | 代詞密度 | 0.052 | 0.069 | 第二人稱 0.010 vs 0.021 | | 單音節詞占比 | 0.483 | 0.379 | | | 雙音節詞占比 | 0.445 | 0.532 | 雙音節詞數是兩種篩法都選出的關鍵特徵 | | 詞形例比 | 0.725 | 0.543 | 實詞豐富度 0.822 vs 0.647 | | 平均依存距離 | 3.900 | 3.659 | 最大 29.452 vs 23.991 | | 篇章段落數 | 1.442 | 3.681 | ChatGPT **分更多段** | | 平均段長(字) | 123.907 | 92.747 | | | 標點密度 | 0.135 | 0.136 | 見下節 | `JIANG-CCL-2025`(笑話單句,四個 2025 模型):詞彙豐富度人類 0.547 vs LLM 0.384–0.461;平均詞頻排位人類 4247 vs LLM 2772–3436(LLM 用詞更常見)。這與 `ZHU-CCL-2023` 的「人類用高頻詞較多」方向相反,體裁與模型世代不同,不能合併成規則。 ## 不是訊號的項目(量測為零、矛盾或缺失) | 項目 | 證據 | 處置 | |---|---|---| | 標點總密度、逗號句號計數 | 同一 HC3-zh 語料兩種量法方向相反:標點密度 0.135 vs 0.136(`ZHU-CCL-2023`)、PUNCT 詞性占比 16.0% vs 13.4%(`GUO-HC3-2023`)。英文新聞 PUNCT 占比人類 11.88% vs LLaMA 10.77–11.43%、Mistral 10.92%、Falcon 12.14%(`MUNOZ-ORTIZ-2024`,一個模型高於人類)。逗號、句號、分號、冒號、驚嘆號、引號的人機分項計數,英文與中文皆無;韓文逗號(`KATFISH-2025`:連接語尾接逗號 4.10% vs 19.83%)與日文逗號位置(Zaitsu 2023)不能外推 | 寫進 `style-pass.md` §7 whitelist | | 破折號 | `FREEBURG-2026`:每千字 GPT-4.1 10.62、Claude Opus 4.6 9.09、DeepSeek V3 6.95、GPT-4o 4.12、GPT-5.4 1.43、Llama 3.x 0.00;人類 3.23(n = 8,範圍 0.33–17.12)。OpenAI 2025-11 宣布可關閉。是 release 屬性,不是模型通用 tell;第三方量測不屬於 `model-fingerprints.md` 的 vendor guidance 契約 | whitelist 一列;不進 fingerprints | | 段落長度、段落數 | WikiHow:ChatGPT 段落較長(82.01 vs 68.83 詞,`GODGHASE-2024`);LLM 寫的論文:段落較短(39.82 vs 51.12 詞,`LLM-REVAL-2025`);HC3-zh:ChatGPT 段落較多(3.681 vs 1.442)。`PUDASAINI-2026` 指出偵測基準裡「段落數」是格式產物(AI 中位數 1 段 vs 人類 17 段) | 只保留「同一篇內段落長度一致」(`discourse-pass.md` §3 既有);whitelist 一列 | | 段落位置規律(主題句在首、總結句在尾) | 只有質性描述(`HERBOLD-2023`:所有 ChatGPT 結論以 "In conclusion" 開頭),無量化 | 不新增 | | burstiness 公式 | GPTZero 的定義是散文描述,無公式,2023 秋停用;學術上對擴散模型與改寫都失效 | 不新增 | | 可讀性公式 | Flesch 系列由詞長主導而非句長(Fredrick 2025:T-unit 較短卻 FKGL 較高);中文 CRIE 沒有任何 AI 文本研究使用 | 不新增 | | 中文常用詞方向 | 兩篇相反(上節) | 不新增 | ## 對 skill 的結構性啟示(Sepia 設計推論) 1. **檢查離散度,不檢查長度。** 唯一的候選訊號是「相鄰三句以上長度趨同的連串」,對應 Desaire 的相鄰句長差特徵,任何語言、任何計數單位都適用。不用短句/長句的切點計分:各研究的尾端比率是語料層級、體裁專屬,且單位不一(G、M 以 token 計新聞導言,D 以詞計科學段落),一段裡沒有極短或極長句是人類常態,推不出段落層級的切點。中文以字計的均值已在 40 字上下,更說明詞數切點無法轉移。 2. **修法只搬字。** 拆一句、併兩句、刪一個子句;不加字(LAMP 74/18/8)。不能全砍短:均勻的短句是同一個缺陷的反面,也是模仿海明威的樣板。 3. **Gude 量到的 2025 模型缺的是短句尾巴。** 產出待檢文本的那個模型(review 與 refactor 診斷階段看 author,write 看 executor)是 Gude 實測過的四個 2025 對齊 release(Qwen 2.5、LLaMA 3.3、Mistral v0.3、GPT-4o)之一時,打破連串的方向是補短句;其他家族(含 Claude、Gemini)沒有句長研究,方向從文本本身判讀(長句連串補一短句,短句連串補一長句)。這是修法的方向提示,不是偵測條件。 4. **標點與段落只看同篇內的一致性。** 任何跨篇的計數規則都會被下一個 release 或下一個語料推翻。 5. **中文另立校準檔。** 英文詞表不能逐字轉移;能轉移的是形狀(§2 句型、§4 回補、§5 節奏)。中文自己的量測只有一個語料,邊界要寫在檔案裡。 ## 讀者端證據(2026-09-10 補) - `ZHENG-2026`:124,615 則 ICLR 人類審稿(2018–2025)對照 81,850 則凍結 LLM 審稿。人類評分每年都隨論文文內句長 SD 上升(標準化 β 合併 2018–2020 +0.045、2023–2025 +0.052),凍結評審讀不到(−0.020、−0.001);非領域詞彙複雜度的人類係數從 +0.142 掉到 −0.015,凍結評審維持 +0.080~+0.082。雙重閘門下,詞彙複雜度的漂移成立(DiD −0.0100,q=0.013),句長變異的人類效應成立(2023–2025 +0.0396,q<0.001)但「人類比以前更獎勵」不成立(DiD −0.0005,q=0.896)。這是專家讀者的偏好,不是偵測器特徵;只支持 §5 檢查的方向,不給門檻。限學術審稿場域。 ## 證據邊界 - 沒有任何可取得的同儕審查論文印出英文文內句長 SD/CV 的人機數值;網路流傳的 GPTZero 式「SD 低於 4 = AI」在文獻裡沒有出處。 - ResearchGate 標注給 Shalevska 2025 的「dispersion 16.4 vs 4.8/5.8」在原文中不存在;原文只有均值 19.28 vs 14.38 詞與每篇均值範圍 15.67–25.60 vs 12.33–17.64。 - 2025 世代的句法證據只有 `GUDE-2026` 一篇 preprint、一種體裁(NYT 導言)、且 prompt 本身限制「兩三句」,可能自己壓掉短句。 - 人類基線異質:NYT 記者、*Science* 作者、L2 學生、ICNALE 母語者、Wikipedia 編者。均值方向隨基線翻轉,離散度方向不翻。 - 句法層沒有研究涵蓋 Claude 或 Gemini(Reinhart:GPT-4o + Llama 3;Gude:Qwen、LLaMA 3.3、Mistral、GPT-4o)。StoryScope 與 LAMP 都不報告句長或段長統計。 - 中文量化證據只有 2023 年 GPT-3.5 世代的簡體開放域問答語料,未經 prompt;台灣學術界沒有任何以繁體語料做人機文體量化比較的研究;台灣來源全是編輯經驗或英文研究轉述。