探索AI 時代的考試公平公正:從 UNAM 遠距考試崩壞談起——全球性的教育公共工程與公共危機(上)

作者:陳銀欉 先生

一、序言

當「鎖定瀏覽器」遇上「鏡頭外的隱形幫手」

回顧2024 年夏天,墨西哥國立自治大學(Universidad Nacional Autónoma de México,UNAM)首次大規模實施全遠距入學考試,當時約 16 萬名考生透過鎖定瀏覽器與 AI 鏡頭監考軟體應試。
但是成績公布後,異常數據瞬間引爆爭議:滿分 120 分中,100 分以上的比例從往年約 3.5% 飆升至 16.3%;110 分以上更從 0.9% 激增至 5.5%。
當時的專家推估,近半數考生可能透過鏡頭外的輔助工具——ChatGPT、耳機、他人代考、第二螢幕或即時搜尋——完成作弊。
最終,校方成立專家委員會調查,決定要求約 5.8 萬名相關考生參加「實體控制考試」(Control Exam),並以實體成績作為最終錄取依據,校長公開向誠實考生致歉,強調此舉是為了「確保考試公平性所必需」。

這起事件並非孤例,它像一面鏡子,映照出全球高等教育在 AI 浪潮下的結構性脆弱。
按照遠距考試原本被寄予厚望——擴大教育機會、降低地理與經濟門檻、提升行政效率——卻在 AI 生成工具的普及下,迅速暴露出「技術防弊」與「人類動機」之間的巨大落差。
考試成績本應是能力的客觀表徵,卻在瞬間變成可疑的數字;公平正義本應是教育制度的基石,卻在大規模作弊嫌疑下瀕臨崩解。

本文試圖從 UNAM 事件出發,重新思考三個核心問題:

第一,AI 時代考試成績的「公平公正」究竟意味著什麼?

第二,未來的評量制度應如何設計,才能在技術便利與誠信保障之間取得平衡?

第三,這場危機為何已成為全球性的教育公共工程與公共危機,而我們又該如何系統性地回應?

二、UNAM 事件的深層結構:技術、動機與制度的三重失靈

1.技術防弊的幻覺
鎖定瀏覽器與 AI 鏡頭監考,表面上構築了「封閉空間」:考生無法切換視窗、無法使用其他應用程式,鏡頭則試圖捕捉異常行為。然而,AI 工具的進化速度遠超防弊技術的迭代。ChatGPT 等大型語言模型可以即時生成高品質答案;無線耳機可以接收遠端提示;第二螢幕可以放置在鏡頭死角;甚至「代考者」可以透過共享螢幕或語音指導完成整場考試。技術防弊本質上是「防君子不防小人」的遊戲——它假設考生會遵守規則,卻低估了人類在高利害關係下的創造力與風險偏好。
更關鍵的是,AI 監考本身也存在誤判風險。光線變化、網路延遲、考生正常動作(如揉眼、轉頭思考)都可能被標記為「可疑行為」。當系統對誠實考生產生誤報、對作弊者卻毫無察覺時,技術反而成為新的不公平來源。

2.高利害動機的放大效應
大學入學考試是典型的「高利害評量」(high-stakes assessment)。對多數墨西哥家庭而言,UNAM 的錄取幾乎等同於社會流動的門票。當錄取名額有限、競爭激烈時,作弊的預期收益遠高於被抓的風險。AI 工具大幅降低了作弊的技術門檻與心理負擔——過去需要複雜的串聯與賄賂,現在只需一個帳號與穩定的網路。動機結構一旦改變,再精密的技術防線也難以抵擋大規模的機會主義行為。

3.制度設計的滯後
UNAM 的遠距考試設計,顯然低估了 AI 時代的作弊可能性。考試形式仍以傳統「封閉式知識測驗」為主,答案可以被即時生成或搜尋。評分標準單一(分數決定一切),缺乏過程性證據或多元能力指標。事後處理雖果斷——要求 5.8 萬人重考——卻也暴露出「事後補救」的高昂成本:時間、金錢、考生心理壓力、社會信任的耗損。制度本應預先設計「防作弊」與「可驗證」的機制,而非在崩壞後才緊急止血。

三、AI 時代「考試公平」的重新定義

傳統考試公平,大致包含三個層面:

  • 機會公平:所有考生在相同條件下應試。
  • 過程公平:考試規則透明、執行一致、監考有效。
  • 結果公平:分數真實反映能力,而非外力干預。

AI 時代,這三個層面都面臨根本挑戰。

「機會公平」不再只是「有沒有電腦與網路」,而是「有沒有穩定的 AI 工具、有沒有隱形的代考網絡、有沒有家庭資源支持作弊」。
「過程公平」則因技術監測的盲區與誤判而變得難以保證。
「結果公平」更是直接被質疑——當分數異常暴增,我們如何判斷哪些分數是「真實能力」、哪些是「工具加成」?
更深刻的問題在於:我們究竟要評量什麼?如果考試目標是「記憶與快速檢索」,AI 幾乎可以完美取代人類;如果目標是「批判思考、創造力、複雜問題解決、倫理判斷」,那麼傳統選擇題與簡答題根本測不到這些能力。
AI 時代的公平,不能再停留在「防止作弊讓分數更準確」,而必須追問:分數本身是否仍具有意義?

四、未來評量的可能路徑:從「防弊」轉向「重新設計」

解決問題的關鍵,不在於打造更強大的監考系統,而在於重新設計「什麼值得被評量」與「如何被評量」。
本文作者提出以下幾個可行方向:

  1. 從「封閉式知識測驗」轉向「開放式、過程性、可驗證的任務」
    未來的入學或能力評量,可以大幅減少「可被即時生成答案」的題型,改採:
  • 長時間專案(例如 2–4 週完成一份研究提案、設計方案或批判性分析報告)。
  • 口試與對話式評量(即時追問、要求解釋推理過程)。
  • 現場實作或模擬情境(在可控環境中完成任務)。
  • 作品集與反思日誌(要求考生說明創作過程、引用來源、反思限制)。
    這些形式的共同特點是:答案無法在幾分鐘內由 AI 完整生成,且過程本身可被觀察與驗證。AI 可以成為工具,但考生必須展現「如何使用工具、如何判斷輸出、如何整合與創新」。
  1. 雙軌或混合模式:遠距便利與實體驗證並存
    完全遠距考試在高利害情境下風險極高。可行的折衷是:
  • 初步篩選採遠距、低利害形式(例如自評、作品提交)。
  • 關鍵決策採實體或高度可控的混合考試。
  • 對遠距考試結果異常者,啟動「控制考試」或抽查機制(如 UNAM 的作法,但應事前制度化而非事後緊急啟動)。
    技術上,可以發展「可驗證計算環境」——考試在特定虛擬機中進行,所有操作可被記錄與審計;或使用區塊鏈技術記錄答題過程的時間戳與完整性。但技術仍只是輔助,核心仍是制度設計。
  1. 能力本位與多元指標取代單一分數
    傳統考試過度依賴單一總分,放大了作弊誘因。未來可以導入:
  • 能力本位評量(competency-based assessment):明確定義「批判思考」「資料素養」「倫理判斷」等具體能力,並以多種證據證明。
  • 形成性評量與總結性評量並重:過程中的表現也計入最終結果。
  • 相對排名與絕對標準並用,降低「一分定生死」的極端壓力。
    當分數不再是唯一貨幣,作弊的邊際效益就會下降。
  1. AI 素養本身成為評量對象
    與其禁止 AI,不如將「如何有效、負責任地使用 AI」納入評量。考生被允許使用指定工具,但必須:
  • 清楚標註哪些部分由 AI 生成。
  • 解釋為何採用特定輸出、如何驗證其正確性。
  • 展示自己在 AI 輸出基礎上的原創貢獻。
    這不僅解決作弊問題,更直接培養 AI 時代最核心的能力。
  1. 國際標準與技術治理的協調
    考試公平已是跨國議題。各國大學、考試機構、科技公司需要建立共同原則:
  • 透明的 AI 使用政策。
  • 可審計的監考與評分系統。
  • 對異常數據的快速回應機制。
  • 保護考生隱私與數據安全的最低標準。
    這需要國際組織(如 UNESCO、OECD)與區域聯盟的協調,而非各國各自為政。

五、全球性的教育公共工程與公共危機

UNAM 事件之所以重要,不僅因為它影響了 5.8 萬名考生,更因為它揭示了一個全球性的結構問題:教育評量作為「社會信任的基礎設施」,正在被 AI 技術快速侵蝕。

這是「教育公共工程」,因為考試制度是現代社會分配機會、認證能力、維持社會流動的核心機制。它需要長期投入、多方協作、持續維護——如同道路、電力、醫療體系。當這套基礎設施失效,社會信任會迅速崩解:誠實者感到被背叛,作弊者感到被獎勵,機構公信力下降,最終可能引發更廣泛的教育與社會危機。

這也是「教育公共危機」,因為問題具有系統性、跨國性、加速性。AI 工具的普及速度遠超制度調適速度;高利害動機在全球競爭加劇下持續強化;技術防弊的軍備競賽成本高昂且效果有限。
若不系統性回應,未來可能出現:

  • 遠距教育的信任崩塌,機會平等的理想受挫。
  • 考試產業與監考科技的畸形膨脹。
  • 社會對「能力認證」的普遍懷疑,導致文憑貶值與人才錯配。
  • 各國在教育公平上的差距進一步擴大(資源豐富者更能鑽漏洞或購買防弊服務)。

六、解決教育問題的系統性路徑

單點技術修復遠遠不夠。需要從三個層級同時推進:

  1. 機構層級
    各大學與考試機構應立即:
  • 重新審視所有高利害遠距考試的設計。
  • 建立異常偵測與控制考試的標準作業流程。
  • 投資於能力本位與過程性評量的研發。
  • 公開透明地溝通政策,重建信任。
  1. 政策層級
    政府與教育主管機關應:
  • 制定 AI 時代評量的國家指引。
  • 支持研究與試點計畫,探索新評量模式。
  • 規範監考科技的隱私與公平標準。
  • 將「考試誠信」納入教育品質指標。
  1. 全球層級
    國際社會應:
  • 建立跨國對話平台,分享最佳實踐與失敗教訓。
  • 推動「負責任 AI 在教育中的使用」原則。
  • 支持發展中國家在評量基礎設施上的能力建設,避免全球教育鴻溝擴大。

七、結語

教育從危機到轉型的契機

UNAM 的 5.8 萬人重考,是痛苦的補救,卻也是必要的警鐘。它告訴我們:技術可以擴大機會,也可以放大不公;考試可以認證能力,也可以淪為遊戲。AI 時代的公平公正,不能再依賴「把考生鎖在虛擬房間裡」的幻想,而必須重新定義「我們真正想測量的是什麼」,並設計出能夠真實反映、且難以被輕易偽造的評量體系。

這場變革是全球性的教育公共工程——需要教育工作者、政策制定者、技術開發者、學生與社會共同參與。它也是教育公共危機——若我們繼續用舊地圖尋找新大陸,信任的崩解將比任何單一作弊事件更為深遠。

未來的考試成績,不應只是「誰在規定時間內答對最多題」,而應是「誰能在 AI 輔助的世界中,展現出不可替代的思考、判斷與創造」。當我們開始朝這個方向設計評量,教育公平才真正有可能被重新建立——不是靠更嚴格的監控,而是靠更深刻的理解:教育的本質,始終是培養人,而非製造可被機器輕易複製的分數。

教育界的園丁
陳銀欉 敬述

這個網誌中的熱門文章

探索中原河洛文化在世界—— 潁川學大放光明:從台灣語言教育走向全球文明交流

自然科學和數學參考書籍和線上課程的推薦

潁川學的歷史精神—— 從潁川不亡論到世界文明的憲政啟示

「成功燈塔行」引領成功學子航向理想的目的地

用電腦代數系統計算高中數學

潁川學的歷史沿革與中華文明意義—— 從舜裔陳氏到東亞宗族文化的精神源流

物理學,化學,生物學參考教科書

《潁川學》脈絡下的漢語發展史探索—— 從中原河洛到台灣話,兼論中華漢語文明的未來形態

用電腦和 AI 輔助數學學習

台灣心理韌性研究與實踐 ——從科學證據到全球教育的行動藍圖