Spokenly Dashboard 裡有一張「平均速度」卡片。我原本只想用它看這週口述得多不多,卻在調整中英混雜的字數計算方式後卡住了。
它背後叫作 WPM:Words Per Minute,每分鐘幾個 word。
問題是,我口述 Introduction 時,明明只唸了一個英文單字;如果照打字測速的規則,它卻會變成好幾個標準化 word。同一個 word,怎麼會有兩種算法?
這張卡片於是從一個小小的 Debug,變成一連串的「為什麼」,最後一路問回打字機時代。
第一個問題:我口述的 word 到底是什麼?
這個問題其實不是一次想通的,而是連改了三版。
第一版最直覺:中文一個字算一個單位;英文直接算它有多少字元;標點不計入。它很容易實作,但馬上碰到一個怪問題:Introduction 有十幾個字元,卻只是我口述的一個英文單字。它被放大成十幾倍,好像我真的用嘴巴把每個字母拼出來。
第二版因此改成:中文一個字算一個單位;英文一個完整單字算一個單位;標點不計入。這才是在回答一個很單純的問題:我這次到底說出了多少內容?
用這個定義,Introduction 算 1,Claude 算 1,一個中文字也算 1。這很符合口述的物理感受:我不是用嘴巴把 I-n-t-r-o-d-u-c-t-i-o-n 一個字母一個字母拼出來,而是唸過一個詞。
「口述字數」和「平均速度」都應該沿用第二版的內容量定義。否則長英文單字會被不合理地放大,平均速度看起來也會突然失真。
可是,當我想把這個數字拿去估算「如果改用鍵盤打字,要多花多久」,新的問題就出現了。
第二個問題:WPM 裡的 W,是哪一種 word?
WPM 的 W 不是字典裡真正的英文單字。它是打字測速為了公平比較而建立的人為單位:Standard Word。
1 Standard Word = 5 characters這裡的 characters 包含字母、空白、標點和其他輸入字元。理由很簡單:若把真正英文單字直接拿來測速,I 算 1 個 word,internationalization 也算 1 個 word,兩段文字根本無法公平比較鍵盤工作量。
早在 19 世紀,電報系統就需要把不等長的訊息換成可計費、可比較的固定單位。1875 年的國際電報規則已用固定字元群組處理電碼的計費與傳輸量。
到了 20 世紀初,打字競賽又遇到同一個問題:不同文章裡的英文單字長短不一,怎麼公平比較輸入速度?這個世界逐漸採用「每 5 個 characters 算 1 個 Standard Word」的方式。York University 的文字輸入研究說明稱它為 5-stroke word equivalent,也明確把它視為自早期打字競賽以來長期沿用的測速慣例。
它不是由某一位學者或某個國際組織一次宣布的唯一官方規格,而是一路成為打字課、測速研究與線上打字平台共同採用的事實標準。兩個世界使用不同工具,卻都得先解決同一件事:如何把長短不一的文字,換成可以公平比較的尺。
1875 國際電報規則 1900 年代初打字競賽固定字元群組 5-stroke word equivalent處理計費與傳輸量 比較輸入速度 │ │ └──────────┐ ┌────────────┘ ▼ ▼ 同一個標準化問題 把不等長文字換成可比較的尺 │ ▼ 5 Characters = 1 Standard Word │ ▼ WPM / 打字速度 Spokenly Dashboard 的鍵盤輸入等價量因此,I love typing. 在現代 WPM 慣例裡有 14 個字元,會換成 2.8 個 Standard Words。它量的不是「我表達了幾個詞」,而是「輸入這段英文大約有多少鍵盤工作量」。
為什麼偏偏是 5?
英文原文語料的研究曾得到約 4.7 個字母的平均單字長度,所以 5 是一個合理、好計算的近似值。但語料不同,平均值也會變;這不是「英文單字天生平均剛好五個字母」的自然定律。
更重要的是,4.7 可以解釋 5 這個數字為什麼實用,卻不能證明當年正是依這個統計數字制定規則。兩者數值相近,但沒有找到建立因果關係的歷史文獻。
這套標準化方式一路進入打字課與測速系統。樣本更大的 Dhakal 等人研究分析 1.36 億次按鍵後,得到一般使用者平均約 52 WPM;一篇 BMJ 的研究也明確採用了「5 個字元(含空白)算 1 word」的定義。
同一個問題,交給四個 AI 分頭查
到這裡我才知道,原本那個「字數 ÷ 50」的公式偷偷混用了兩種單位:分子是口述內容量,分母卻是鍵盤輸入速度。它看起來能算,實際上沒有說清楚自己在算什麼。
這個問題沒有直接可套用的答案,所以我沒有只問一個模型,而是把同一個問題交給不同公司的 LLM 分頭研究。實際做下去,更像把同一道題分給不同研究員。
Gemini 廣泛搜尋資料,找出新的候選解釋。
Claude 把說法、來源與限制整合成可追查的脈絡。
Codex 獨立檢查單位、算式和最後的程式實作。
GPT 的角色又不一樣。我沒有請它代筆;而是在一起追完 WPM、Standard Word 與歷史脈絡後,再把整篇草稿交給它做潤稿與論證驗證。它從讀者角度指出:真正的主角不是 WPM,而是 Word 的定義;電報和打字競賽不能被寫成已證實的直接傳承;所有後面的公式,都必須回扣到前面定義了什麼。這種檢查不會取代資料查證,卻能抓出一篇文章的論點有沒有站穩。
我不把這個過程理解成「誰答錯了」。不同模型找到不同資料、提出不同觀點,本來就是這種工作方式的價值。重要的是,我們有沒有把每個答案攤開來比較、追問它的前提,最後一起收斂成目前最站得住腳的定義。
我以前以為多 AI 協作的終點,是拿到一份結論。這次才發現,使用者也必須留在驗證鏈裡。WPM、中文輸入法和字數統計都不是我熟悉的領域;如果沒有跟著看推論如何成立、為什麼最後選這個定義,就算 AI 交給我一份結論,我也無從判斷它是真的可靠,還是只是寫得很像真的。
多 AI 協作的真正價值,不是替我直接決定答案,而是逼我把「Word」到底代表什麼先定義清楚。
第三版:為節省時間另算一個不顯示的數字
查清 WPM 的規則後,第三版才出現:中文仍然一個字算一個單位;英文、數字、空白、標點與換行等其餘字元,全部除以 5。它不是拿來取代第二版,而是只用於估算鍵盤輸入成本。
我沒有強迫所有卡片共用一套字數規則,而是新增一個只在背後使用的 keyboard-equivalent units。
口述字數、平均速度= 中文字數 + 英文真實單字數
keyboard-equivalent units= 中文字數 +(其餘原始字元數 ÷ 5)
節省時間= keyboard-equivalent units ÷ 50 − 實際口述分鐘數「其餘原始字元」包含英文、數字、空白、標點和換行。這個第五個數字不顯示在 UI 上,也不拿來算平均口述速度;它只用於建立一個假設:如果要用鍵盤輸入這份最終文字,大約需要多少標準化輸入量?
先把這個假設換成一段鍵盤所需時間,再減掉實際口述時間,兩邊比較的才都是時間。
為什麼我一路問回打字機時代?
我後來才發現,AI 真正改變的不是答案,而是研究的成本。
以前,我不太可能為了一張 Dashboard 卡片,一路追到打字機、電報與文字輸入研究;現在,我可以先把問題拆開,交給不同的 AI 分頭研究,再把其中一輪找到的定義、來源與疑點,交給下一個 AI 從另一個角度驗證。這不必一直把所有東西塞進同一段對話的 Context,也不用一開始就知道該問哪一個問題。
多 AI 協作沒有把研究縮短成一鍵得到答案;它讓我有能力一路追問,直到自己真的理解為止。這也是一張小小的 WPM 卡片,最後會變成這篇文章的原因。
而這一輪追問最後留下了一個可以真正放回工程裡使用的答案:1 Standard Word = 5 characters 不是隨手挑的魔術數字。它有清楚的測速目的、歷史背景和長期使用脈絡。因此,當我要估算鍵盤輸入等價量時,可以有信心地採用它;同時也知道,它不該被拿來冒充「我口述了多少內容」。
所有公式,都建立在定義之上。
開始計算之前,先定義自己究竟想量什麼。