Spokenly Dashboard 裡有一張「平均速度」卡片。我原本只想用它看這週口述得多不多，卻在調整中英混雜的字數計算方式後卡住了。

它背後叫作 WPM：`Words Per Minute`，每分鐘幾個 word。

問題是，我口述 `Introduction` 時，明明只唸了一個英文單字；如果照打字測速的規則，它卻會變成好幾個標準化 word。同一個 word，怎麼會有兩種算法？

這張卡片於是從一個小小的 Debug，變成一連串的「為什麼」，最後一路問回打字機時代。

## 第一個問題：我口述的 word 到底是什麼？

這個問題其實不是一次想通的，而是連改了三版。

第一版最直覺：中文一個字算一個單位；英文直接算它有多少字元；標點不計入。它很容易實作，但馬上碰到一個怪問題：`Introduction` 有十幾個字元，卻只是我口述的一個英文單字。它被放大成十幾倍，好像我真的用嘴巴把每個字母拼出來。

第二版因此改成：中文一個字算一個單位；英文一個完整單字算一個單位；標點不計入。這才是在回答一個很單純的問題：**我這次到底說出了多少內容？**

用這個定義，`Introduction` 算 1，`Claude` 算 1，一個中文字也算 1。這很符合口述的物理感受：我不是用嘴巴把 `I-n-t-r-o-d-u-c-t-i-o-n` 一個字母一個字母拼出來，而是唸過一個詞。

「口述字數」和「平均速度」都應該沿用第二版的內容量定義。否則長英文單字會被不合理地放大，平均速度看起來也會突然失真。

可是，當我想把這個數字拿去估算「如果改用鍵盤打字，要多花多久」，新的問題就出現了。

## 第二個問題：WPM 裡的 W，是哪一種 word？

WPM 的 W 不是字典裡真正的英文單字。它是打字測速為了公平比較而建立的人為單位：**Standard Word**。

```text
1 Standard Word = 5 characters
```

這裡的 characters 包含字母、空白、標點和其他輸入字元。理由很簡單：若把真正英文單字直接拿來測速，`I` 算 1 個 word，`internationalization` 也算 1 個 word，兩段文字根本無法公平比較鍵盤工作量。

早在 19 世紀，電報系統就需要把不等長的訊息換成可計費、可比較的固定單位。[1875 年的國際電報規則](https://history.state.gov/historicaldocuments/frus1875v02/d213)已用固定字元群組處理電碼的計費與傳輸量。

到了 20 世紀初，打字競賽又遇到同一個問題：不同文章裡的英文單字長短不一，怎麼公平比較輸入速度？這個世界逐漸採用「每 5 個 characters 算 1 個 Standard Word」的方式。[York University 的文字輸入研究說明](https://www.yorku.ca/mack/RN-TextEntrySpeed.html)稱它為 `5-stroke word equivalent`，也明確把它視為自早期打字競賽以來長期沿用的測速慣例。

它不是由某一位學者或某個國際組織一次宣布的唯一官方規格，而是一路成為打字課、測速研究與線上打字平台共同採用的事實標準。兩個世界使用不同工具，卻都得先解決同一件事：如何把長短不一的文字，換成可以公平比較的尺。

```text showLineNumbers=false
1875 國際電報規則                  1900 年代初打字競賽
固定字元群組                       5-stroke word equivalent
處理計費與傳輸量                    比較輸入速度
        │                                  │
        └──────────┐          ┌────────────┘
                   ▼          ▼
              同一個標準化問題
          把不等長文字換成可比較的尺
                         │
                         ▼
          5 Characters = 1 Standard Word
                         │
                         ▼
                   WPM / 打字速度
         Spokenly Dashboard 的鍵盤輸入等價量
```

:::tip
兩條脈絡概念相似；沒有直接證據指出電報規則直接演化成打字測速規則。
:::

因此，`I love typing.` 在現代 WPM 慣例裡有 14 個字元，會換成 `2.8` 個 Standard Words。它量的不是「我表達了幾個詞」，而是「輸入這段英文大約有多少鍵盤工作量」。

### 為什麼偏偏是 5？

[英文原文語料的研究](https://users.ugent.be/~wduyck/articles/BrysbaertSuiDuyckDirixInPress.pdf)曾得到約 `4.7` 個字母的平均單字長度，所以 `5` 是一個合理、好計算的近似值。但語料不同，平均值也會變；這不是「英文單字天生平均剛好五個字母」的自然定律。

更重要的是，`4.7` 可以解釋 `5` 這個數字為什麼實用，卻不能證明當年正是依這個統計數字制定規則。兩者數值相近，但沒有找到建立因果關係的歷史文獻。

這套標準化方式一路進入打字課與測速系統。樣本更大的 [Dhakal 等人研究](https://userinterfaces.aalto.fi/136Mkeystrokes/)分析 1.36 億次按鍵後，得到一般使用者平均約 52 WPM；一篇 [BMJ 的研究](https://pmc.ncbi.nlm.nih.gov/articles/PMC9762353/)也明確採用了「5 個字元（含空白）算 1 word」的定義。

## 同一個問題，交給四個 AI 分頭查

到這裡我才知道，原本那個「字數 ÷ 50」的公式偷偷混用了兩種單位：分子是口述內容量，分母卻是鍵盤輸入速度。它看起來能算，實際上沒有說清楚自己在算什麼。

這個問題沒有直接可套用的答案，所以我沒有只問一個模型，而是把同一個問題交給不同公司的 LLM 分頭研究。實際做下去，更像把同一道題分給不同研究員。

Gemini 廣泛搜尋資料，找出新的候選解釋。

Claude 把說法、來源與限制整合成可追查的脈絡。

Codex 獨立檢查單位、算式和最後的程式實作。

GPT 的角色又不一樣。我沒有請它代筆；而是在一起追完 WPM、Standard Word 與歷史脈絡後，再把整篇草稿交給它做潤稿與論證驗證。它從讀者角度指出：真正的主角不是 WPM，而是 `Word` 的定義；電報和打字競賽不能被寫成已證實的直接傳承；所有後面的公式，都必須回扣到前面定義了什麼。這種檢查不會取代資料查證，卻能抓出一篇文章的論點有沒有站穩。

我不把這個過程理解成「誰答錯了」。不同模型找到不同資料、提出不同觀點，本來就是這種工作方式的價值。重要的是，我們有沒有把每個答案攤開來比較、追問它的前提，最後一起收斂成目前最站得住腳的定義。

我以前以為多 AI 協作的終點，是拿到一份結論。這次才發現，使用者也必須留在驗證鏈裡。WPM、中文輸入法和字數統計都不是我熟悉的領域；如果沒有跟著看推論如何成立、為什麼最後選這個定義，就算 AI 交給我一份結論，我也無從判斷它是真的可靠，還是只是寫得很像真的。

多 AI 協作的真正價值，不是替我直接決定答案，而是逼我把「Word」到底代表什麼先定義清楚。

## 第三版：為節省時間另算一個不顯示的數字

查清 WPM 的規則後，第三版才出現：中文仍然一個字算一個單位；英文、數字、空白、標點與換行等其餘字元，全部除以 5。它不是拿來取代第二版，而是只用於估算鍵盤輸入成本。

我沒有強迫所有卡片共用一套字數規則，而是新增一個只在背後使用的 `keyboard-equivalent units`。

```text
口述字數、平均速度
= 中文字數 + 英文真實單字數

keyboard-equivalent units
= 中文字數 +（其餘原始字元數 ÷ 5）

節省時間
= keyboard-equivalent units ÷ 50 − 實際口述分鐘數
```

「其餘原始字元」包含英文、數字、空白、標點和換行。這個第五個數字不顯示在 UI 上，也不拿來算平均口述速度；它只用於建立一個假設：如果要用鍵盤輸入這份最終文字，大約需要多少標準化輸入量？

先把這個假設換成一段鍵盤所需時間，再減掉實際口述時間，兩邊比較的才都是時間。

## 為什麼我一路問回打字機時代？

我後來才發現，AI 真正改變的不是答案，而是研究的成本。

以前，我不太可能為了一張 Dashboard 卡片，一路追到打字機、電報與文字輸入研究；現在，我可以先把問題拆開，交給不同的 AI 分頭研究，再把其中一輪找到的定義、來源與疑點，交給下一個 AI 從另一個角度驗證。這不必一直把所有東西塞進同一段對話的 Context，也不用一開始就知道該問哪一個問題。

多 AI 協作沒有把研究縮短成一鍵得到答案；它讓我有能力一路追問，直到自己真的理解為止。這也是一張小小的 WPM 卡片，最後會變成這篇文章的原因。

而這一輪追問最後留下了一個可以真正放回工程裡使用的答案：`1 Standard Word = 5 characters` 不是隨手挑的魔術數字。它有清楚的測速目的、歷史背景和長期使用脈絡。因此，當我要估算鍵盤輸入等價量時，可以有信心地採用它；同時也知道，它不該被拿來冒充「我口述了多少內容」。

所有公式，都建立在定義之上。

開始計算之前，先定義自己究竟想量什麼。