單元 08參與紀錄與互評規則

Peer Evaluation 與學習證據:記錄學生參與,評量仍由教師負責

先說結論

Peer Evaluation 具有重要的參考價值,但互評結果不能直接轉換為分數。學生互評可呈現小組中不易觀察的貢獻、缺席、溝通、衝突與責任分配;作業版本可用來檢查學生是否修正過想法;補交紀錄能區分有文件支持的說法與事後補述;測驗與 Forms 則反映概念掌握程度。這些資料都屬於評量證據,必須經過整理、對照、解釋與人工覆核,才能形成負責任的評量判斷。

本頁將帶你製作一份「學習證據地圖」。互評分數、互評文字、提交時間、版本紀錄、AI 對話紀錄、測驗題型、申論答案、教師觀察與學生說明,會在同一張地圖中依直接證據、間接線索與背景資料分類。AI 可以協助整理資料、辨識異常、產生覆核問題,並將長篇文字歸納為待查項目;它不得代替教師決定分數,也不得將「同學給予低分」直接解讀為「此人沒有貢獻」。

本頁的核心原則是:請 AI 產生「人工覆核清單」,不得產生「成績結論」。例如,互評資料顯示某位學生的他評偏低時,AI 可以提醒教師檢查該輪提交紀錄、組內文字回饋、出席或課堂活動紀錄;它不能直接寫成「該生不合作,扣 5 分」。作業版本分析若顯示某組後期內容減少、引用減弱,AI 可以提醒教師追問修稿原因,但不得直接判定學生退步或抄襲。

本頁案例取自四類真實教學工作:

這些案例都將評量視為一項需要負責的專業判斷,不能只進行資料加總。

你會完成什麼

完成本頁後,你將取得五項成果:

  1. 「學習證據地圖」:列出一門課可蒐集的資料,並說明每種資料能支持與不能支持的判斷。
  2. 「Peer Evaluation 風險訊號表」:將低他評、自他差距、重複提交、資料缺漏與組名混亂等情況,轉化為待覆核問題。
  3. 「作業版本檢查表」:檢查學生是否呈現修正軌跡、概念是否更清楚、證據是否增加,以及推論是否更為周延。
  4. 「AI 可協助與不可協助清單」:明確排除 AI 直接評分。
  5. 「完成品範例」:示範如何將證據整理為教師可採用的討論與補救依據。

本頁不急著建立複雜的評分系統,而是先說明每種資料的性質與限制。互評文字可能揭露小組內的感受與事件,也可能混入情緒、偏見或報復;提交時間可呈現作業流程,卻不能單獨證明努力程度;AI 對話紀錄能顯示部分思考過程,但不等同個人理解;申論答案呈現推理,必須由人依規準閱讀;選擇題可快速反映概念掌握,卻未必呈現取捨理由。理解資料限制,才能正確運用。

從學員的角度來看,你可能曾在小組作業中承擔較多工作,也可能遇過互評難以如實表達的情況。教師若只看最後簡報,容易忽略工作過程;若只看互評分數,又可能受到人際關係影響。良好的學習證據設計,既要呈現過程,也要使資料可以接受查核。AI 可以協助整理資料,班級脈絡仍須由教師理解。

開場故事

某門課的期末評量包含一項大型小組報告。某組的簡報進行順暢,投影片內容也相當完整;然而,互評資料多次提到兩位組員「很少參與」或「最後才出現」,另一位組員則呈現自評偏高、他評明顯偏低的情況。教師若只看最後作品,可能忽略小組內部的工作負擔;若只依互評判斷,又可能將同學的情緒視為事實。此時最需要的是一份人工覆核清單,而不是由 AI 直接評分。

教師整理資料後發現,這一組在三輪 Peer Evaluation 中都有互評紀錄,但第一輪有大量重複提交,必須先保留每位評分者對每位被評者的最後一筆。第二輪樣本很少,不能和第一輪直接等量比較。第三輪有幾個低他評訊號,但同時也有作業提交紀錄與文字回饋需要對照。更重要的是,組名欄位有些混亂,不能直接用組名做正式判斷,只能以個人層級與課堂紀錄交叉檢查。

若將這些資料直接交由 AI 分析,並詢問「誰該扣分」,很可能得到條理清楚、查核依據卻不足的答案。較適當的指令是:「請將這些資料整理成人工覆核清單。不要給分,也不要判定責任。請列出每位學生需要教師確認的證據、可能解釋與應追問的問題。」如此可將 AI 的任務限定為整理與提醒,評量判斷仍由教師負責。

同一門課後續也處理補交與測驗資料。部分學生透過 email 說明已重新上傳,但線上表單在未登入狀態下無法下載,因此教師不能將口頭或信件說法直接認定為正式提交。具體附件與可比對檔案可先列為候選,其餘資料須等待正式匯出。Microsoft Forms 的選擇題可以設定答案鍵與配分,申論題仍須由教師依規準閱讀。這些程序共同遵守一項原則:資料可以指出需要查核的位置,不能取代人的判斷。

核心觀念

評量的基礎是證據判讀

在這門課中,「評量」是教師根據事先說明的標準,判斷學生所留證據的品質;分數只是其中一種記錄方式。學生的發言、提問、修稿、互評、組內分工、作業版本、反思文字、測驗答案與課堂行動,都可能成為學習證據。資料數量並非愈多愈好,關鍵在於能否說明:這項證據可以支持什麼判斷?不能支持什麼?還需要與哪些資料交叉檢查?

例如,某位學生被同組同學評為「貢獻低」。這是一項重要訊號,但本身不足以證明學生沒有投入。可能原因包括缺席、分工不清、小組衝突,或承擔不易被同組成員看見的準備工作。教師應將訊號納入覆核流程,檢查提交紀錄、文字回饋與課堂觀察,必要時再請學生說明。完成這些查核後,才構成完整的評量程序。

Peer Evaluation 用於辨識需要進一步查核的情況

Peer Evaluation 的價值在於讓小組內部資訊浮上來。它最適合用來發現「需要教師注意」的情況,例如某人長期他評偏低、某人自評與他評差距很大、某輪互評樣本太少、同一人重複提交很多次、文字回饋出現明確事件或衝突。但這些都應該被稱為風險訊號,而不是結論。

實作 Peer Evaluation 前,必須先處理資料品質。同一位評分者若對同一位被評者提交多次,須先訂定保留紀錄的規則;不同輪次若有明顯時間間隔,應分輪處理;組名欄位不完整或不一致時,不宜形成正式的組級結論;某輪樣本過少,也不宜將平均數與其他輪次直接比較。這些資料整理工作同時涉及評量倫理:未清理、未確認,或未說明限制的資料,不應影響學生評量。

版本紀錄呈現學習歷程,使用時仍須保護隱私

學生作業版本是重要的學習證據。從初稿到定稿,可以檢查問題定義是否更清楚、是否加入具體資料、是否修正空泛框架、是否增加替代方案,以及是否開始處理風險與倫理。AI 對話紀錄也可能呈現學生如何提問、修正,以及如何將 AI 內容轉化為自己的判斷。不過,使用這些資料前必須取得合理授權並完成去識別;私人對話或未授權截圖不得用於正式判斷。

版本分析還有一項常見限制:檔案修改時間不一定等於學習時間。在雲端同步資料夾中,檔案時間可能是同步時間,而非學生實際完成作業的時間。正式評量仍須查核 LMS 原始時間、表單時間戳或教師指定的提交管道。AI 可以協助整理可能對應週次的版本線索,但必須標示不確定性,不得將推測寫成事實。

Forms 可處理題型與答案鍵,申論仍須人工評閱

Microsoft Forms 或類似測驗工具可以處理單選題、複選題、配分、答案鍵與保存狀態,適合用於概念掌握或基本知識檢核。題目若涉及申論、取捨或應用推理,便須採用人工評分規準。即使表單已設定申論題每題 10 分,也只代表完成欄位與配分設定,不能據此認定機器可以自行判斷答案品質。

一份完整的申論評分規準應說明核心知識正確性、回答完整度、邏輯與應用推理等面向。教師可以請 AI 將學生答案整理成待查摘要,例如「這份答案提到取捨,但未說明代價」「這份答案引用概念,但未連結具體情境」。最終仍須由教師依規準閱讀;AI 不得直接給分。

人工覆核保障學生與教師

人工覆核會讓流程慢一點,卻同時保護學生與教師。學生知道自己的資料不會被機器直接貼標籤;教師也知道判斷有資料支持,遇到例外還有處理方法。覆核不用每一筆重做,集中檢查高風險訊號即可,包括低他評、自他差距極大、重複提交、資料缺漏、名稱對不到、組名混亂、補交說法無正式紀錄、AI 對話與最後作品高度不一致,以及需要主觀判斷的申論答案。

覆核紀錄應先列為「待確認」,不得在證據尚未完整時寫成「已判定」。例如,將「S08 沒有貢獻」改寫為「S08 在 PA1 與 PA3 的他評偏低,需對照提交紀錄與文字回饋」;將「S14 抄襲 AI」改寫為「S14 的 AI 對話紀錄與最後作品高度相似,需確認課程規則、引用方式與改寫程度」。這種寫法較為精確,也能避免過早定性。

案例拆解

案例一:用去識別資料重建 Peer Evaluation 清理流程

以下數字取自過往完成的分析紀錄,已移除課名、姓名、學號與可識別組別,並改寫為流程教學案例。原始資料共有 964 筆回覆,直接計算平均數會受到重複提交影響。因此,處理時先將相鄰提交時間差距超過 7 天的資料切分為不同輪次,再針對同一輪、同一評分者與同一被評者,保留最後提交版本。清理後共有 223 筆去重資料,移除 741 筆重複或修訂紀錄,並整理出 58 位代號學員的摘要。完成去重後,資料才適合進一步判讀。P08-S02

清理後,三輪資料的性質仍不相同。第一輪橫跨 3 月 27 日至 4 月 10 日,原始筆數最多,清理後仍有 198 筆;第二輪集中於 4 月 23 日,樣本僅有 6 筆去重資料;第三輪為 6 月 5 日至 6 月 7 日,共有 19 筆去重資料。直接比較三輪平均數,會忽略樣本差異與活動背景。較適當的做法,是將各輪視為性質不同的證據:第一輪用於觀察較大範圍的小組運作,第二輪僅作局部提醒,第三輪則用於辨識期末前後的風險訊號。

這份分析也為 50 位學生產生不同類型的警示。警示只表示教師需要進一步查核,不能用來認定學生有問題。警示來源包括低他評、自評高於他評、文字回饋與提交紀錄。若直接依警示扣分,便是將資料整理結果誤當成正式評量。正確流程是將警示列入人工覆核表,再由教師對照其他資料。

案例二:Peer Evaluation 保留於成績工作簿,但不直接計分

後續處理成績工作簿時,Peer Evaluation 被納入同一份工作表,但未直接計入期中或期末總分。表中保留他評平均、自評平均、自他差、各輪他評與警示欄位,供教師檢查與討論,不由公式自動決定學生分數。這項設計明確區分「資料進入工作簿」與「資料納入評分」。P08-S03

合併過程還發現名稱對應與來源稽核問題。例如有些學生只出現在互評資料中,與原成績表對不上;有些名字存在差異,需要人工確認;有些警示需要回到原始文字或提交紀錄。這些問題提醒我們,教育資料常常不是乾淨的資料表。學生姓名、組別、學號、語言版本、表單時間、補交附件,都可能出現不一致。AI 可以協助比對可疑項,但不能自行決定兩個名字一定是同一人,更不能因為找不到對應就做負面判斷。

案例三:作業版本分析呈現學習軌跡

以下作業資料夾盤點是依教師過往整理經驗重新合成的教學資料,不對應任何真實班級或學生。資料包含 37 個代號資料夾、27 份可見提交、10 個沒有檔案的資料夾、322 個檔案,其中 177 個是主要作業,144 個是 AI 對話或聊天紀錄,另有少數抽取錯誤。分析時刻意將主要作業與 AI 對話分開:主要作業可用於觀察內容與主題連續性;AI 對話僅作為思考歷程的示範,不得據此推定真實分組,也不得用於正式評分。

版本分析可以呈現具體的學習變化。有些小組初期僅套用分析框架,後續逐步補充資料、提出具體行動建議,並開始討論風險與治理;有些小組的初稿具有情境細節,定稿反而只剩抽象敘述。教師可以根據這些變化提供回饋,例如:「你們的問題定義更清楚,但證據仍不足」「你們開始處理利害關係人,但尚未說明取捨」「你們保留許多 AI 對話紀錄,最後作品卻未呈現自己的判斷」。這類回饋比單一分數更能協助學生修正。

版本分析必須保留不確定性。檔案時間若是雲端同步時間,便不能據此認定「學生在某日某時完成修稿」;小組成員名單若由作業文字推估,也不能視為正式分組;AI 對話紀錄若只出現在部分學生資料夾,更不能用來比較全班。這些限制必須寫入報告,AI 輸出時也須明確標示。學習證據的可信程度來自清楚的來源與限制,而非資料數量。

案例四:補交與 Forms 顯示資料管道的界線

處理補交資料時,部分學生透過 email 說明已重新上傳,但教師當下無法取得正式表單匯出,因此無法直接驗證新提交。具有附件、檔案或可比對資料者,可先列為「新增補交候選」;在正式確認前,不得直接寫入成績,也不得以學生的文字說明取代正式匯出。採用一致且可查核的管道,才能同時保障學生說明權與程序公平。

Forms 案例也說明,完成工具匯入後仍須人工檢查。五種語言版本的期末考表單匯入後,逐份確認第 1 至 30 題為單選、第 31 至 52 題為複選、第 53 至 54 題為多行文字。接著設定答案鍵與配分,總分為 160 分;選擇題可由答案鍵處理,兩題申論各 10 分,仍須依評分規準判讀。這項流程可讓學生理解:題型設定、答案鍵與配分屬於資料結構,申論品質則由教師負責判斷。

從 BARS 量表到 GAS 線上填答系統

開啟團隊成員自評與互評 BARS 參考文件

這份文件以行為錨定評量表(BARS)整理團隊成員表現。只寫「1 分很差、5 分很好」,幾乎無法協助同儕判斷;1、3、5 分都應對應可觀察行為。主要面向包括團隊工作貢獻、團隊互動、維持團隊進度、品質要求,以及相關知識與技能。

請先用紙筆檢查量尺。每一項描述是否真的能被同組成員觀察?「很有熱忱」「有領導力」若沒有對應行為,就很容易變成人際印象。較好的描述會寫出是否準時交付、是否主動提供資料、是否回應同儕意見、是否發現進度問題,以及是否能在需要時協助他人完成工作。

接著,把量表改成可部署於 GAS 的線上填答系統。系統至少要有:匿名或代碼化的填答者與被評者、組別、評量輪次、每一項行為題、信心分數、文字證據、重複提交處理、補交方式、去識別匯出及教師覆核頁。先用合成資料測試,不要一開始就放入真實姓名、學號或成績。

AI 可以協助產生表單欄位、GAS 程式、資料清理與待查清單,但不能把低分直接解讀成低貢獻,也不能自動決定正式成績。若要自動化,請保留原始資料、規則版本、觸發原因與人工覆核結果。

Glasp 可用來標註公開文章、PDF 或影片,整理成後續可查找的閱讀資料。它適合協助蒐集與匯出,不代表摘要內容已經正確。涉及付費文章、學生資料或未公開文件時,仍要先確認授權與隱私。

先不用 AI

活動名稱:證據、推論、決定三色卡

這個活動完全不使用電腦。每組拿到 18 張情境卡,每張都是一小段匿名資料。三種顏色分工如下:綠色是「可觀察證據」,黃色是「可能推論」,紅色是「不能直接做的決定」。分類後,每組挑三張最有爭議的卡,寫下「還需要什麼資料」。

情境卡範例如下。

卡號內容建議分類為什麼
E01S-A01 在 PA1 他評平均明顯低於班級中位數證據這是互評資料中的觀察結果
E02S-A01 一定沒有做事不能直接決定低他評不能直接推論缺席或不合作
E03S-A01 需要對照提交紀錄與文字回饋推論這是合理的覆核方向
E04S-B03 自評 24,他評 15證據自他差距是可觀察訊號
E05S-B03 自我認知錯誤不能直接決定可能有分工不可見或互評偏差
E06第二輪只有少量互評資料證據樣本數本身是資料限制
E07第二輪平均比第一輪低,所以全班退步不能直接決定樣本不同,不能直接比較
E08某組最後作品比初稿更具體證據可由版本文字比對支持
E09某組一定沒有使用 AI不能直接決定沒有 AI 紀錄不代表沒有使用
E10補交 email 提到已重新上傳證據有學生說法,但需正式管道確認

No AI 產出格式

每組提交一張「證據到判斷」表。第一欄記錄觀察到的資料,第二欄寫出資料能支持的最低限度說法,第三欄說明不能直接形成的結論,第四欄列出下一步人工覆核。這項活動特別練習使用審慎而精確的語言:將「這位學生沒貢獻」改為「互評出現低貢獻訊號,需對照提交紀錄與文字回饋」;將「這組退步」改為「後期版本的證據密度下降,需詢問修稿原因」。

形成判斷前先檢查證據

請區分「觀察到的資料」與「對資料的解釋」。依低分認定不合作、依補交信認定已完成提交、依 AI 對話認定作業由 AI 代寫,或依申論篇幅認定理解良好,都是在證據不足時過早形成結論。檢視每一筆資料時,請依序確認:它最低限度能支持什麼?還有哪些可能解釋?哪些說法需要更多證據?哪些說法可能損害學生權益?

使用 AI 整理待查訊號

活動名稱:請 AI 產生人工覆核清單

這項活動允許使用 AI,但必須先界定任務範圍:AI 只整理待查訊號,不給分、不判定責任,也不替教師作出最終決定。請將去識別的互評摘要、版本摘要與補交摘要納入指令,要求 AI 依規則列出教師後續需要查核的資料。輸出若出現分數、扣分、人格判斷、缺席判定或懲處建議,即視為測試失敗。

測試資料

以下資料是教學用匿名資料,不是任何學生的正式成績。

student_idroundpeer_avg_25self_score_25peer_counttext_signalsubmission_signal
S-A01PA113.5235兩則回饋提到會議較少出現有初稿檔,缺少修訂說明
S-A01PA314.0244一則回饋提到最後整合不足有定稿檔,但版本差異小
S-B03PA120.0205多數回饋描述資料蒐集穩定有初稿與定稿
S-C07PA221.0221只有一筆資料第二輪樣本不足
S-D02PA316.0154回饋提到簡報練習缺席有 email 說明補交,未見正式匯出
S-E09PA122.0255回饋正向,但自評略高有 AI 對話紀錄與最後作品

版本摘要:

group_idearly_versionfinal_versionai_log_notedata_limit
G-01初稿只有三個框架名詞,缺少例證定稿加入市場資料與風險段落有提問紀錄,但最後作品有自行整合檔案時間可能是同步時間
G-02初稿有案例細節與兩個替代方案定稿刪除替代方案,只保留單一建議AI 對話多為生成摘要需確認課堂口頭報告
G-03初稿與定稿相似度高定稿只改格式無 AI 紀錄不能因此推論未使用 AI

預期輸出

AI 的合格輸出應該像這樣:

review_id對象訊號不能直接說建議人工覆核
R01S-A01PA1 與 PA3 他評偏低,自評偏高,文字提到出席與整合不能直接說沒有貢獻,也不能直接扣分對照會議紀錄、提交版本、組內分工說明;必要時請學生簡述實際工作
R02S-C07PA2 只有一筆互評不能拿單筆資料做正式比較將 PA2 標記為低信心,回看 PA1/PA3 或教師觀察
R03S-D02有補交 email,但未見正式匯出不能直接認定補交完成等待正式表單或 LMS 匯出,先列候選
R04G-02定稿比初稿少了替代方案不能直接說退步或偷懶請小組說明刪除理由,檢查口頭報告是否補足取捨

不合格輸出常包含「建議扣幾分」「這位同學不合作」「這組退步」「AI 生成比例過高所以不及格」等句子。若出現這類內容,應退回並修正指令,不得納入正式紀錄。

AI 活動紀錄表

引導式工具

工具入口:Peer Evaluation 人工覆核清單

GPTs/Gems 引導式工具 工具包 v1.0.0

06-peer-evaluation

Peer Evaluation 證據整理助手

本頁使用模式去識別資料與人工覆核

整理互評與參與紀錄中的待查訊號,不直接評分,也不將資料差異解讀為人格特質。

開始前請準備

  • 一份已去識別的 CSV 或 XLSX。
  • 這次最想檢查的問題;不確定時可先不寫。

工具會先協助你

  1. 檢查資料是否仍含姓名、學號、電子郵件或其他可辨識身分的內容。
  2. 讀取欄位與資料量,只追問看不懂的欄位。
  3. 整理低樣本、自他差距、缺值與異常提交等人工待查訊號。
可以從這句開始

我要檢查一份 Peer Evaluation 資料。我會先上傳已去識別的 CSV 或 XLSX。

預期完成成果

  • 資料品質檢查
  • 人工覆核清單
  • 正式紀錄方式與後續查核安排

設定包內含核心指令、知識檔、對話開場與測試案例。建立 GPT 或 Gem 後,上傳現有資料或簡要說明需求,工具便會依序提問並協助完成。

如何檢核工具

先確認輸出只包含「可觀察證據」「可能解釋」「不能直接說什麼」「建議人工覆核」四個欄位。若出現分數、扣分、人格標籤、懲處建議,或將單一匿名意見寫成個人事實,該輸出不得採用。接著檢查低樣本數是否標示為低信心、補交是否仍待正式管道確認,以及所有學生資料是否已完成去識別。

保存測試紀錄

請記錄工具、日期、測試資料與結果。若第一次輸出出現分數,不應只刪除該列;請回到指令調整規則後重新測試。失敗紀錄也須保存,以便在正式使用前辨識最容易越過任務邊界的情況。

自助填答

一、學習證據地圖

二、Peer Evaluation 覆核規則

三、AI 使用邊界

完成品範例

學習證據看板 v0.1

以下提供一份可供教師使用的完成品範例。全表只使用學生代號與小組代號,不包含真實姓名;輸出僅列出後續應查核的資料,不涉及分數。

review_id對象可觀察證據不能直接說教師下一步
R01S-A01PA1、PA3 他評偏低,自評偏高;文字提到會議與整合不能直接說沒有貢獻或應扣分對照提交紀錄、組內分工、教師觀察;必要時請學生說明
R02S-C07第二輪只有一筆互評資料不能將第二輪平均與其他輪次進行正式比較標示低信心,回看其他輪與課堂紀錄
R03S-D02email 說明補交,但正式匯出尚未確認不能直接認定補交完成等正式管道匯出;附件可先列候選
R04G-02定稿刪除替代方案,AI 對話多為摘要不能直接說退步或 AI 代寫請小組說明刪除理由,檢查最後簡報是否補足取捨
R05全班申論題需要依規準判讀不能讓表單或 AI 自動判定申論品質由教師按核心知識、完整度、邏輯與應用推理評閱

課堂回饋範例

給學生的回饋語氣可以這樣寫:

「你的互評資料出現兩個需要回看的訊號:第一,你在 PA1 與 PA3 的他評低於同組多數成員;第二,你的自評與他評差距較大。這些資料不能直接代表你沒有貢獻,所以本週請你補一份 300 字工作說明,寫清楚你在資料蒐集、討論、撰稿、簡報或整合中實際完成的工作,並附上可查核的版本或紀錄。教師會把你的說明、組內文字回饋與提交紀錄一起看。」

「你們小組的初稿與定稿相比,定稿少了替代方案與取捨理由。這不一定代表退步,也可能是你們在簡報時另有說明。請在修正版中補上:你們曾考慮哪兩個替代方案?為什麼保留目前方案?放棄方案的代價是什麼?這份補充會和定稿一起作為學習歷程證據。」

「你的申論題答案有提到正確概念,但目前看不出你如何把概念放進情境。請依照評分規準補強兩件事:第一,指出情境中的具體事實;第二,說明你選擇此判斷時放棄了什麼。AI 可以協助你檢查是否有漏掉欄位,但最後內容必須由你自己完成。」

完成品查核清單

查核項目合格標準人工覆核結果
去識別教材與 AI 測試資料不含真實姓名、學號、私訊或未授權內容待填
資料品質已說明分輪、去重、樣本不足與名稱對應限制待填
AI 邊界AI 只輸出覆核清單,不輸出分數或懲處待填
Peer Evaluation低他評與自他差距被標為風險訊號,不是結論待填
版本分析有標示推論與低信心,不把同步時間當提交時間待填
Forms選擇題與申論題分開處理,申論保留人工規準待填
學生溝通回饋語氣說明證據、限制與下一步,不貼標籤待填

常見失敗與修正

失敗一:以互評平均數推論學生品格。 互評分數偏低時,最多只能說「互評資料中出現需要確認的訊號」。不得據此認定學生懶散、不合作或不負責,也不得直接扣分。每個低分訊號都應搭配覆核問題:這個低分來自幾位評分者?是否集中在某一輪?文字回饋是否描述具體事件?提交紀錄是否支持或反駁這項說法?學生是否有機會補充自己的工作證據?

失敗二:將自評高於他評直接解讀為自我膨脹。 自他差距明顯時,確實需要進一步了解,但可能原因包括:學生負責不易被同組看見的資料整理或協調工作、小組尚未形成共同的貢獻標準、學生高估自己的投入,或班級互評文化尚未成熟。自他差距應作為對話起點,而非結論。教師可以要求學生以證據說明實際工作,也可以請小組重新界定「貢獻」的具體內容。

失敗三:忽略樣本數與資料輪次。 第二輪只有少量回覆時,平均數無論偏高或偏低,都不適合直接與其他輪次比較。每一輪都應標示樣本數、活動背景與信心程度。樣本不足可以列入教師觀察清單,但不宜作為正式判斷的核心。若資料只來自一位評分者,須明確標示「低信心」,並對照其他輪次或課堂紀錄。

失敗四:將補交說明視為正式提交。 學生的 email、口頭說明或截圖都可能提供重要資訊,但不等同正式提交紀錄。正式表單或 LMS 尚未匯出時,教師不應直接修改成績。可設置「補交候選」狀態:有附件、可比對檔案或可查時間者先列入候選;只有文字說明者等待正式資料;所有候選均保留來源與處理日期。這樣既能回應學生主張,也能維持程序公平。

失敗五:用 AI 對話紀錄推定作品由 AI 代寫。 AI 對話紀錄可以顯示學生問過什麼、如何修改、是否有把建議轉成自己的判斷,但不能單獨證明代寫。沒有 AI 紀錄也不能證明沒有使用 AI。修正方式是看最後作品是否有自己的取捨、是否能口頭說明、是否引用課程材料、是否符合課程規則。AI 對話紀錄只能放在學習歷程脈絡中閱讀。

失敗六:讓 AI 產生表面中立的排名。 有些 AI 輸出會使用「高風險」「中風險」「低風險」排序,甚至提出優先處理名單。若缺乏明確定義,這類分類容易形成學生標籤。應改用「覆核優先順序」,並在每一列說明資料限制。優先順序只代表教師查核資料的次序,不表示某位學生的問題較為嚴重。

資料納入正式評量前的準備

如果已取得互評資料,第一步應先訂定資料處理規則,再使用 AI 進行整理。分輪、去重、樣本不足、姓名無法對應,以及文字回饋保留方式,都須在查看結果前完成定義,避免因特定學生的資料而調整標準。愈早確立處理規則,後續爭議愈少。

第二步是建立去識別測試資料。真實姓名、學號、完整互評文字或私訊,不得直接用於 AI 測試。請以代號取代身分資訊,只保留足以測試的欄位,例如輪次、他評平均、自評、評分人數、文字訊號、提交訊號與資料限制。如此既能檢查 AI 是否遵守規則,也能保護學生資料。

第三步是設計教師回應模板。資料顯示某位學生需要進一步了解時,教師應備有可直接使用的說明文字,無須由 AI 代寫判定。完整的模板包含三項資訊:教師根據哪些資料提出關切;這些資料不能直接代表什麼;學生或小組需要補充哪些證據。這種說明方式能讓學生知道教師已檢視資料,也願意了解事情脈絡。

第四步是分開處理申論題與選擇題。選擇題可以依答案鍵與配分處理;申論題則須依規準閱讀。AI 可以將申論答案整理為「是否出現概念」「是否連結情境」「是否說明取捨理由」,但每一列都必須標示「需要人工評閱」。若工具或流程可能使人誤以為申論題可以自動給分,應在規則中明確禁止。

完整案例:從互評偏誤到學生申覆的一次處理

假設期末小組專題結束後,教師收到三輪 Peer Evaluation、各組作業版本、課堂出席註記、補交紀錄與 Forms 測驗結果。某組的最後作品完成度高,但互評資料中有兩位學生需要進一步了解:S-A01 他評偏低、自評偏高;S-D02 在第三輪被提到缺席簡報練習,同時也有 email 說明家中臨時狀況,並附上補交文件。此時若直接請 AI 判斷「誰該扣分」,風險相當高。較適當的做法,是將流程分為資料整理、偏誤辨識、人工覆核、學生說明與申覆處理五個階段。

第一階段是資料整理。教師先固定去重規則:同一輪、同一評分者與同一被評者若有多筆紀錄,保留最後提交;輪次依活動日期或明顯的時間間隔切分;每一輪均標示評分人數。接著將身分改為匿名代號,移除真實姓名、學號、私訊截圖與完整抱怨原文,只保留教學判斷所需的訊號,例如「兩則回饋提到較少出席會議」「一則回饋提到最後整合不足」「只有一筆資料」。完成去識別後,AI 才能協助整理;未去識別資料不得交由 AI 處理。

第二階段是偏誤辨識。Peer Evaluation 至少有五種常見偏誤:

  1. 互惠偏誤:同組好友互相給予高分,不代表實際貢獻一定較高。
  2. 報復偏誤:小組衝突後互評偏低,不代表被評者沒有完成工作。
  3. 能見度偏誤:負責資料清理、聯絡與整合者,其貢獻可能不如簡報者容易被看見。
  4. 語言與表達偏誤:不擅長公開發言的學生,可能被誤認為參與較少。
  5. 時間點偏誤:某輪若正逢考試、病假或家庭事件,單輪評價不足以代表整學期。

教師不必以偏誤為每一項紀錄辯解,但應將其列為可能解釋,避免把同學觀感直接視為事實。

第三階段是 AI 分析後的人工覆核。此時可請 AI 輸出表格,但欄位必須固定為「可觀察證據」「可能解釋」「不能直接說什麼」「需教師確認」「建議溝通」。以 S-A01 為例:

若 AI 直接輸出「建議扣 3 分」,整列資料都應退回,不得進入正式紀錄。

第四階段是對照參與證據。教師應將互評資料與版本歷程合併檢視。若 S-A01 的名字出現在早期資料蒐集檔、修訂紀錄或小組分工表中,便需要更審慎地解釋低他評;即使完全沒有提交痕跡,也不能立即形成判定,仍須查找口頭報告、會議紀錄或教師觀察。S-D02 的 email 與附件可列為補交候選,但正式表單或 LMS 尚未匯出前,不得認定補交完成。Forms 測驗結果只能補充概念掌握狀況,不能取代小組貢獻判斷。經過交叉查核,才能將同學觀感轉化為教師可查證的資料。

第五階段是學生說明與申覆流程。教師若準備依互評或版本紀錄調整回饋,應先提供資料摘要,不宜公開同學的完整原始評論。通知可以寫成:

「你的互評資料出現兩項需要確認的訊號:第一,兩輪他評低於同組多數成員;第二,自評與他評差距較大。這些訊號目前不代表扣分決定。請在三天內提供 300 至 500 字說明,列出你實際完成的工作、可查版本或同組協作證據。教師會將你的說明、互評摘要、提交紀錄與課堂觀察一併檢視。」

這段文字同時說明教師看見的資料、尚未形成的判斷,以及學生可以採取的具體回應方式。

申覆處理也須留下固定紀錄。學生回覆後,教師應在表格中記錄:學生提供哪些新證據、哪些已確認、哪些仍無法確認、原互評訊號是否需要重新解釋,以及最後採取何種教學回應。教學回應未必涉及改分,也可能包括確認補交、請小組補充分工說明、提供個別回饋、安排下一次小組工作規則,或維持原判斷並補充理由。若資料仍不足,請記錄「資料不足,維持低信心」,不要形成超出證據的結論。

這個完整案例也說明 AI 在評量流程中的合理位置。AI 可以將 200 則互評文字整理為匿名訊號、辨識自他差距、提醒樣本不足,並將學生說明整理成待查項目。至於誠信、參與責任、扣分與申覆是否成立,仍須由教師檢視資料、聽取說明並記錄理由。學生能針對具體證據回應,評量才具備應有的可信度。

這套流程也能回饋下一次課程設計。若多位學生反映資料整理工作不易被看見,下次互評表可新增貢獻類型,並分項詢問實際工作;若爭議多半來自組名或姓名無法對應,下次表單應先固定名冊與組別;若補交經常受限於正式匯出,教師則應事先說明哪些管道才構成有效提交。互評既是期末評量工作,也是下一輪課程設計的資料。AI 可以協助辨識模式,教師再據此調整規則,使程序更為公平。

交互診斷也是一種學習證據

教學實踐研究計畫中的交互診斷,不是請同學替作品打一次總分。另一組先閱讀 A 文本,在資訊不完整的情況下作出第一判斷;作者再依 B 文本主持三個關鍵追問;最後雙方比較原先判斷與作者的教學設計。教師可從這段互動觀察:讀者是否抓到重要線索、作者能否提出有效追問,以及回饋後的作品是否真的修正。P08-S15

因此,Peer Evaluation 可以增加「作品讓我看見什麼問題」「哪一項證據不足」「哪一個追問改變了我的判斷」「作者後來如何修正」等欄位,不必只問合作態度。AI 可協助整理匿名回饋與版本差異,教師仍要判斷哪些證據足以支持結論。學員閱讀版列出歷程、作品、互動、量化與反思五類證據,可用來補強自己的評量設計。

本頁重點與下一步

今天的重點是:將學生留下的資料整理為可討論、可查核的證據,不得交由機器直接轉換成分數。Peer Evaluation 呈現不易觀察的小組互動;作業版本記錄修正過程;補交紀錄釐清資料管道;Forms 則協助管理題型與配分。評量標準、資料限制與例外情況,仍須由教師處理。

回到自己的課程後,請先選擇一項資料進行小規模練習:

每一個步驟都要確認:這筆資料能支持什麼?不能支持什麼?最終由誰作出判斷?

下一頁將進入 Codex 與多代理工作流程,討論如何將大型任務分配給不同 Agent。本頁先確立一項底線:無論使用多少 Agent、建立多完整的資料表,或取得多流暢的 AI 摘要,都不能取代教師對學生學習所負的責任。AI 可以協助辨識更多線索,最後仍由人決定如何回應學生。

來源與延伸閱讀

標示網路連結者可直接開啟;未附連結者為已去識別或內部教學實作紀錄,僅用來說明本頁內容依據,不提供原始學生、企業或私人資料。

P08-S01 Peer Evaluation 分析實作紀錄;收錄分輪、去重、警示與 teamName 欄位的處理方式。

P08-S02 CM216 Peer Evaluation 分析報告;案例包含 964 筆原始回覆、223 筆去重資料、三輪紀錄與風險訊號。

P08-S03 Peer Evaluation 併入成績工作簿實作紀錄;互評作為參考與稽核欄位,不直接納入總分。

P08-S04 學生作業版本分析實作紀錄;說明如何整理作業、AI 對話紀錄,以及正式評量前為何仍須確認 LMS 與官方分組。

P08-S05 數位轉型學生作業進步分析報告;以問題定義、證據、具體行動與風險治理觀察版本變化。

P08-S06 Weekly Task 補交追蹤實作紀錄;說明 email、正式匯出資料與補交候選名單之間的界線。

P08-S08 Microsoft Forms 答案鍵與配分實作紀錄;涵蓋單選、複選、申論配分與申論人工評分規準。

P08-S09 Microsoft Forms 匯入實作紀錄;說明題目匯入後仍須逐份確認題型。

P08-S15 吳相勲,〈從「被動解題」到「主動出題」:以生成式 AI 輔助學生自產內容(SGC)建構商業敏銳度與批判性思維〉,115 年度教學實踐研究計畫申請稿,2025-12-12。本頁使用學員閱讀版摘要,說明交互診斷與多元學習證據的安排。

本頁圖解

學習證據地圖。證據、推論、人工覆核
學習證據地圖證據、推論、人工覆核
Peer Evaluation 不是判決。風險訊號、不是判決、看更多證據
Peer Evaluation 不是判決風險訊號、不是判決、看更多證據
作業版本時間線。初稿、修正、取捨、定稿
作業版本時間線初稿、修正、取捨、定稿
Forms 與申論人工評閱。選擇題答案鍵、申論人工評閱、規準
Forms 與申論人工評閱選擇題答案鍵、申論人工評閱、規準
AI 只產生覆核清單。待查、不能直接說、教師決定
AI 只產生覆核清單待查、不能直接說、教師決定

離開前,做一件事

完成本頁

請確認已完成本頁指定的作品,並記下下一步需要補充的內容。