Trả lời ngắn: Có căn cứ, nhưng không "chính xác" theo nghĩa tuyệt đối. Một nghiên cứu học thuật năm 2024 chấm 55 bài Writing Task 2 thật bằng ChatGPT-4 rồi đối chiếu với điểm giám khảo IELTS chính thức, đo được mức khớp khá cao ở quy mô tổng thể (hệ số kappa 0.811) — con số này nhiều khả năng chính là nguồn gốc của câu "AI chấm khớp giám khảo thật khoảng 81%" đang lan truyền. Nhưng cùng nghiên cứu đó cũng ghi nhận nhiều bài lệch rõ ở mức từng bài, và tác giả kết luận AI chưa nên thay giám khảo thật. Bài này giải thích con số 81% thực sự đo gì, AI mạnh/yếu ở tiêu chí nào, và nên dùng AI chấm Writing thế nào cho đúng.
Câu "ChatGPT chấm khớp giám khảo thật khoảng 81%" xuất hiện khá nhiều trên các bài chia sẻ, blog trung tâm luyện thi và bài đăng cá nhân, phần lớn không dẫn lại nghiên cứu gốc nên nghe như một con số tự nó đúng. Khi truy ngược, con số khớp gần nhất với một nghiên cứu học thuật công bố năm 2024, và cách con số đó được tính ra khác khá xa với việc "cứ 100 bài thì 81 bài AI chấm trúng band".
Nghiên cứu lấy 55 bài Writing Task 2 đã có sẵn điểm chính thức, thu thập công khai từ website IDP, website IELTS chính thức và bộ đề luyện Cambridge. Tác giả cho ChatGPT-4 (bản chạy tháng 11/2023) đóng vai giám khảo IELTS, chấm lại từng bài theo rubric Task 2, rồi so điểm AI với điểm chính thức đã có.
Writing IELTS chấm theo 4 tiêu chí: Task Achievement/Task Response (TA/TR), Coherence and Cohesion (CC), Lexical Resource (LR) và Grammatical Range and Accuracy (GRA). Trong 4 tiêu chí này, GRA và LR có đặc điểm chung: phần lớn lỗi ở đây là lỗi có thể chỉ ra cụ thể — sai thì hoặc động từ chia sai, hoặc từ dùng không đúng nghĩa/văn phong, hoặc cấu trúc câu bị lặp quá nhiều.
Đây đúng là dạng việc mô hình ngôn ngữ làm tốt: quét qua từng câu, đối chiếu với quy tắc ngữ pháp và cách dùng từ phổ biến, rồi chỉ ra chỗ sai kèm gợi ý sửa. Cơ chế này gần giống công cụ kiểm tra ngữ pháp (grammar checker) mà nhiều người đã quen dùng, chỉ khác là được đóng khung theo thang điểm IELTS.
Ngược lại, TA/TR và CC đòi hỏi một dạng đánh giá khác hẳn. Task Response cần trả lời được câu hỏi "bài này có thực sự bàn đúng và đủ vào đề bài không, lập luận có phát triển đủ sâu không" — một bài có thể viết câu đúng ngữ pháp, dùng từ hay, nhưng lạc đề hoặc chỉ lặp lại ý mà không phát triển thêm. Coherence and Cohesion cần đánh giá xem mạch ý có thực sự trôi chảy với người đọc hay không, chứ không chỉ đếm xem có bao nhiêu từ nối (linking words) xuất hiện.
Đây là hạn chế nhiều bài chia sẻ thực hành nhắc tới: mô hình có xu hướng thấy nhiều từ nối là cho là "mạch lạc", trong khi giám khảo được đào tạo sẽ đọc xem ý sau có thực sự nối tiếp hợp lý ý trước hay không. Tương tự, một số bài dùng cấu trúc câu phức nhưng sai ngữ pháp lại được AI khen "có tham vọng ngôn ngữ" thay vì bị trừ điểm đúng mức như giám khảo thật.
Gộp lại thành bảng dễ tra. Cột "Mức tin cậy" là ước tính định tính, không phải số đo chính thức của Cambridge/IDP/British Council — vì chưa có nghiên cứu công bố tách riêng độ chính xác của AI theo từng tiêu chí Writing.
| Tiêu chí | AI làm tốt | AI dễ sai | Mức tin cậy (ước tính) |
|---|---|---|---|
| GRA Ngữ pháp |
Bắt lỗi chia động từ, cấu trúc câu sai, liệt kê lỗi cụ thể kèm sửa | Đôi khi khen "câu phức" dù cấu trúc đó sai, thay vì trừ điểm | Tương đối cao |
| LR Từ vựng |
Gợi ý từ đồng nghĩa, phát hiện từ lặp, chỉ ra collocation sai | Đôi khi gợi ý từ "học thuật" nhưng không hợp văn cảnh câu | Tương đối cao |
| CC Mạch lạc – Liên kết |
Nhận diện thiếu từ nối, đoạn quá dài/quá ngắn | Dễ nhầm "nhiều từ nối" với "mạch lạc thật sự"; bỏ sót lỗi logic giữa các ý | Cần thận trọng |
| TA/TR Trả lời đề |
Kiểm tra đủ số từ, có đề cập các phần của đề bài | Khó nhận ra lạc đề tinh vi, lập luận hời hợt nhưng "nghe có vẻ đủ ý" | Cần thận trọng |
| Band tổng thể | Gần với điểm thật ở quy mô trung bình nhiều bài (nghiên cứu 2024) | Có thể lệch 1–1.5 band ở một bài cụ thể; không ổn định giữa các lần chấm | Khớp cao ở tổng thể, dao động ở từng bài |
Xu hướng thường được nhắc tới là "AI hay chấm cao hơn thực tế". Nhưng độ lệch không chỉ đi một chiều. Có một chia sẻ lan truyền trên mạng (không thể xác minh danh tính người viết, nên chỉ dùng để minh hoạ hiện tượng, không phải bằng chứng thống kê): một thí sinh viết cùng một dạng bài ở nhà, được AI chấm dao động khoảng band 6.5–7.5 qua nhiều lần thử, nhưng khi đi thi thật với đề tương tự lại đạt band 8.0 — tức là AI chấm thấp hơn hẳn so với kết quả thi thật trong trường hợp này.
Ví dụ này ngược với xu hướng "AI hay chấm cao hơn" mà nhiều người vẫn nhắc — cho thấy độ lệch không cố định theo một hướng. Điều này khớp với những gì Koraishi (2024) quan sát qua biểu đồ so sánh: có bài AI chấm cao hơn giám khảo thật, có bài chấm thấp hơn, không theo quy luật rõ ràng ở mức từng bài.
Giám khảo IELTS thật trải qua đào tạo, kiểm định định kỳ (standardisation) và có cơ chế chấm chéo để giữ độ nhất quán — đây là lý do độ tin cậy giữa hai giám khảo con người (khoảng 0.92 theo IELTS.org, trích trong nghiên cứu trên) cao hơn mức AI đạt được. Một mô hình tổng quát như ChatGPT không qua quy trình hiệu chỉnh chuyên biệt đó. Vài yếu tố khiến điểm AI chấm dao động giữa các lần thử:
AI chấm Writing không "vô dụng" và cũng không "đáng tin tuyệt đối" — đây là công cụ có điểm mạnh và giới hạn rõ ràng. Cách dùng hợp lý:
Tính năng chấm IELTS Writing bằng AI của IELTS 8020 cho band theo đúng 4 tiêu chí, trích ra câu sai cụ thể để sửa, kết quả trong khoảng 1 phút. Đây là công cụ hỗ trợ luyện tập để bạn thấy nhanh chỗ cần sửa — không thay thế giám khảo thật, và không nên dùng làm căn cứ duy nhất để quyết định đăng ký thi.
🤖 Thử chấm Writing bằng AI →Không tuyệt đối, nhưng có căn cứ. Nghiên cứu 2024 trên 55 bài Task 2 đo được mức khớp khá cao với giám khảo thật ở quy mô tổng thể, nhưng vẫn lệch rõ ở nhiều bài riêng lẻ — nên tác giả kết luận AI chưa nên thay giám khảo thật.
Nhiều khả năng bắt nguồn từ hệ số kappa 0.811 trong nghiên cứu trên, bị diễn giải lại thành "81% chính xác" — cách nói không hoàn toàn đúng, vì kappa đo mức đồng thuận, không phải tỷ lệ bài chấm đúng tuyệt đối.
Theo quan sát không chính thức, AI thường nhỉnh hơn thực tế ở band 7 trở lên. Nhưng độ lệch có thể đi cả hai chiều — cũng có trường hợp AI chấm thấp hơn hẳn điểm thi thật.
Hữu ích nhất với Ngữ pháp (GRA) và Từ vựng (LR) — lỗi rà được cụ thể. Với Trả lời đề (TA/TR) và Mạch lạc — Liên kết (CC), AI dễ sai vì cần đọc hiểu ngữ cảnh và lập luận.
Không nên dùng làm căn cứ duy nhất. Xem là tín hiệu tham khảo nhanh, kết hợp bài mẫu chuẩn band và ý kiến giáo viên có kinh nghiệm trước khi quyết định.
Vì AI không qua quy trình đào tạo và kiểm định định kỳ như giám khảo thật. Đổi phiên chat, đổi model, hay chỉ đổi cách diễn đạt câu lệnh đều có thể cho band khác nhau ở cùng một bài.
Đọc bài mẫu Writing band 8–9 đã được xây dựng theo đúng 4 tiêu chí, để có điểm đối chiếu ngoài điểm AI chấm — miễn phí, không cần đăng nhập.
📄 Xem bài mẫu Writing band 8–9 →
Nguồn tham khảo:
Koraishi (2024) — Language Teaching Research Quarterly, 43, 22–42 ·
IELTS.org — Test statistics ·
IELTS Writing band descriptors
Số liệu không dẫn trực tiếp từ nghiên cứu học thuật nêu trên đều được ghi rõ trong bài là kinh nghiệm thực
hành, không phải kết quả kiểm chứng độc lập. Bài viết mang tính tham khảo, không thay thế đánh giá của giám
khảo IELTS thật.