Blog IELTS 8020 · Writing & AI

Chấm IELTS Writing bằng AI/ChatGPT có chính xác không: test thực tế và giới hạn

Cập nhật 08/2026 · Đọc ~9 phút · Cho người đang cân nhắc dùng AI để tự chấm Writing

← Tất cả bài Blog

Trả lời ngắn: Có căn cứ, nhưng không "chính xác" theo nghĩa tuyệt đối. Một nghiên cứu học thuật năm 2024 chấm 55 bài Writing Task 2 thật bằng ChatGPT-4 rồi đối chiếu với điểm giám khảo IELTS chính thức, đo được mức khớp khá cao ở quy mô tổng thể (hệ số kappa 0.811) — con số này nhiều khả năng chính là nguồn gốc của câu "AI chấm khớp giám khảo thật khoảng 81%" đang lan truyền. Nhưng cùng nghiên cứu đó cũng ghi nhận nhiều bài lệch rõ ở mức từng bài, và tác giả kết luận AI chưa nên thay giám khảo thật. Bài này giải thích con số 81% thực sự đo gì, AI mạnh/yếu ở tiêu chí nào, và nên dùng AI chấm Writing thế nào cho đúng.

1. Con số "81%" đến từ đâu — và nó thực sự đo cái gì

Câu "ChatGPT chấm khớp giám khảo thật khoảng 81%" xuất hiện khá nhiều trên các bài chia sẻ, blog trung tâm luyện thi và bài đăng cá nhân, phần lớn không dẫn lại nghiên cứu gốc nên nghe như một con số tự nó đúng. Khi truy ngược, con số khớp gần nhất với một nghiên cứu học thuật công bố năm 2024, và cách con số đó được tính ra khác khá xa với việc "cứ 100 bài thì 81 bài AI chấm trúng band".

Nghiên cứu lấy 55 bài Writing Task 2 đã có sẵn điểm chính thức, thu thập công khai từ website IDP, website IELTS chính thức và bộ đề luyện Cambridge. Tác giả cho ChatGPT-4 (bản chạy tháng 11/2023) đóng vai giám khảo IELTS, chấm lại từng bài theo rubric Task 2, rồi so điểm AI với điểm chính thức đã có.

KẾT QUẢ CHÍNH
  • Điểm trung bình AI chấm và điểm trung bình giám khảo thật trùng nhau ở mức tổng thể (đều là 6.027/9) — nhưng đây là trùng ở số trung bình cộng của cả 55 bài, không phải trùng ở từng bài.
  • Hệ số tương quan nội lớp (ICC = 0.814) và hệ số kappa có trọng số (weighted kappa = 0.811) — cả hai đều được xếp vào mức "đồng thuận mạnh" theo thang thống kê thường dùng, nhưng đây là hệ số đo mức tương quan, không phải "tỷ lệ % số bài chấm đúng tuyệt đối".
  • Khi soi vào từng bài một, vẫn có những bài lệch rõ giữa điểm AI và điểm giám khảo thật — biểu đồ so sánh trong bài báo cho thấy một số cặp điểm cách nhau tới cả 1–1.5 band.
  • Tác giả cũng dẫn lại số liệu công bố của IELTS.org: độ nhất quán giữa hai giám khảo con người với nhau (inter-rater reliability) vào khoảng 0.92 — cao hơn mức 0.811–0.814 mà AI đạt được. Nói cách khác, ngay cả khi AI làm khá tốt, con người vẫn nhất quán với nhau hơn AI.
MINH HOẠ: ĐIỂM AI CHẤM so với ĐIỂM GIÁM KHẢO THẬT — 12 BÀI 9.0 7.0 5.0 4.0 Bài 1Bài 2Bài 3 Bài 4Bài 5Bài 6 Bài 7Bài 8Bài 9 Bài 10Bài 11Bài 12 Điểm giám khảo thật Điểm AI chấm Bài 4 và bài 9 lệch rõ nhất — khoảng 1 đến 1.5 band, dù trung bình cả nhóm vẫn gần khớp. Số liệu minh hoạ dựng lại theo mô tả xu hướng của Koraishi (2024) — không phải điểm thật của học viên nào.
Mức khớp cao ở quy mô tổng thể (trung bình cả nhóm) không đồng nghĩa mọi bài đều được chấm đúng.
📌 Nguồn: Koraishi, O. (2024). The Intersection of AI and Language Assessment: A Study on the Reliability of ChatGPT in Grading IELTS Writing Task 2. Language Teaching Research Quarterly, 43, 22–42. doi.org/10.32038/ltrq.2024.43.02 — bài báo mở, đọc miễn phí.
⚠️ Giới hạn của chính nghiên cứu này: mẫu chỉ 55 bài, chỉ thử Writing Task 2 (chưa thử Task 1 hay Speaking), và chỉ dùng một phiên bản ChatGPT-4 tại một thời điểm (11/2023). Mô hình hiện tại có thể cho kết quả khác — không có gì đảm bảo con số 0.811 vẫn đúng với công cụ bạn đang dùng hôm nay.

2. AI mạnh ở đâu: ngữ pháp và từ vựng — thứ đếm được

Writing IELTS chấm theo 4 tiêu chí: Task Achievement/Task Response (TA/TR), Coherence and Cohesion (CC), Lexical Resource (LR)Grammatical Range and Accuracy (GRA). Trong 4 tiêu chí này, GRA và LR có đặc điểm chung: phần lớn lỗi ở đây là lỗi có thể chỉ ra cụ thể — sai thì hoặc động từ chia sai, hoặc từ dùng không đúng nghĩa/văn phong, hoặc cấu trúc câu bị lặp quá nhiều.

Đây đúng là dạng việc mô hình ngôn ngữ làm tốt: quét qua từng câu, đối chiếu với quy tắc ngữ pháp và cách dùng từ phổ biến, rồi chỉ ra chỗ sai kèm gợi ý sửa. Cơ chế này gần giống công cụ kiểm tra ngữ pháp (grammar checker) mà nhiều người đã quen dùng, chỉ khác là được đóng khung theo thang điểm IELTS.

💡 Nhiều giáo viên và bài chia sẻ thực hành khuyên dùng AI đúng cho việc này: soát lỗi ngữ pháp và nâng cấp từ vựng cho bài viết, thay vì hỏi AI "bài tôi được mấy band". Đây là khuyến nghị phổ biến trong cộng đồng dạy — luyện IELTS, dựa trên quan sát thực tế nhiều hơn là một nghiên cứu định lượng riêng cho từng tiêu chí, nên xin ghi rõ đây là kinh nghiệm thực hành, không phải số liệu khoa học.

3. AI yếu ở đâu: trả lời đề và mạch lạc — thứ cần đọc hiểu ngữ cảnh

Ngược lại, TA/TR và CC đòi hỏi một dạng đánh giá khác hẳn. Task Response cần trả lời được câu hỏi "bài này có thực sự bàn đúng và đủ vào đề bài không, lập luận có phát triển đủ sâu không" — một bài có thể viết câu đúng ngữ pháp, dùng từ hay, nhưng lạc đề hoặc chỉ lặp lại ý mà không phát triển thêm. Coherence and Cohesion cần đánh giá xem mạch ý có thực sự trôi chảy với người đọc hay không, chứ không chỉ đếm xem có bao nhiêu từ nối (linking words) xuất hiện.

Đây là hạn chế nhiều bài chia sẻ thực hành nhắc tới: mô hình có xu hướng thấy nhiều từ nối là cho là "mạch lạc", trong khi giám khảo được đào tạo sẽ đọc xem ý sau có thực sự nối tiếp hợp lý ý trước hay không. Tương tự, một số bài dùng cấu trúc câu phức nhưng sai ngữ pháp lại được AI khen "có tham vọng ngôn ngữ" thay vì bị trừ điểm đúng mức như giám khảo thật.

⚠️ Nhận định trên đến từ quan sát thực hành của giáo viên luyện thi, không phải trích từ nghiên cứu Koraishi (2024) — nghiên cứu đó chỉ chấm band tổng, chưa tách riêng từng tiêu chí. Nên hiểu là kinh nghiệm thực tế, chưa được kiểm chứng bằng thống kê độc lập theo từng tiêu chí.

4. Bảng so sánh: AI vs giám khảo thật theo từng tiêu chí

Gộp lại thành bảng dễ tra. Cột "Mức tin cậy" là ước tính định tính, không phải số đo chính thức của Cambridge/IDP/British Council — vì chưa có nghiên cứu công bố tách riêng độ chính xác của AI theo từng tiêu chí Writing.

Tiêu chíAI làm tốtAI dễ saiMức tin cậy (ước tính)
GRA
Ngữ pháp
Bắt lỗi chia động từ, cấu trúc câu sai, liệt kê lỗi cụ thể kèm sửa Đôi khi khen "câu phức" dù cấu trúc đó sai, thay vì trừ điểm Tương đối cao
LR
Từ vựng
Gợi ý từ đồng nghĩa, phát hiện từ lặp, chỉ ra collocation sai Đôi khi gợi ý từ "học thuật" nhưng không hợp văn cảnh câu Tương đối cao
CC
Mạch lạc – Liên kết
Nhận diện thiếu từ nối, đoạn quá dài/quá ngắn Dễ nhầm "nhiều từ nối" với "mạch lạc thật sự"; bỏ sót lỗi logic giữa các ý Cần thận trọng
TA/TR
Trả lời đề
Kiểm tra đủ số từ, có đề cập các phần của đề bài Khó nhận ra lạc đề tinh vi, lập luận hời hợt nhưng "nghe có vẻ đủ ý" Cần thận trọng
Band tổng thể Gần với điểm thật ở quy mô trung bình nhiều bài (nghiên cứu 2024) Có thể lệch 1–1.5 band ở một bài cụ thể; không ổn định giữa các lần chấm Khớp cao ở tổng thể, dao động ở từng bài

5. Một ví dụ thực tế: điểm có thể lệch theo cả hai chiều

Xu hướng thường được nhắc tới là "AI hay chấm cao hơn thực tế". Nhưng độ lệch không chỉ đi một chiều. Có một chia sẻ lan truyền trên mạng (không thể xác minh danh tính người viết, nên chỉ dùng để minh hoạ hiện tượng, không phải bằng chứng thống kê): một thí sinh viết cùng một dạng bài ở nhà, được AI chấm dao động khoảng band 6.5–7.5 qua nhiều lần thử, nhưng khi đi thi thật với đề tương tự lại đạt band 8.0 — tức là AI chấm thấp hơn hẳn so với kết quả thi thật trong trường hợp này.

Ví dụ này ngược với xu hướng "AI hay chấm cao hơn" mà nhiều người vẫn nhắc — cho thấy độ lệch không cố định theo một hướng. Điều này khớp với những gì Koraishi (2024) quan sát qua biểu đồ so sánh: có bài AI chấm cao hơn giám khảo thật, có bài chấm thấp hơn, không theo quy luật rõ ràng ở mức từng bài.

💡 Bài học thực tế: nếu AI chấm bài bạn ở mức bạn không hài lòng, đừng vội kết luận trình độ thật của bạn đúng như vậy — và ngược lại, nếu AI chấm cao, cũng đừng coi đó là bảo chứng chắc chắn cho điểm thi thật. Cả hai chiều lệch đều đã có người gặp phải.

6. Vì sao điểm AI chấm không ổn định giữa các lần

Giám khảo IELTS thật trải qua đào tạo, kiểm định định kỳ (standardisation) và có cơ chế chấm chéo để giữ độ nhất quán — đây là lý do độ tin cậy giữa hai giám khảo con người (khoảng 0.92 theo IELTS.org, trích trong nghiên cứu trên) cao hơn mức AI đạt được. Một mô hình tổng quát như ChatGPT không qua quy trình hiệu chỉnh chuyên biệt đó. Vài yếu tố khiến điểm AI chấm dao động giữa các lần thử:

  • Đổi phiên chat/model: hỏi lại cùng một bài ở một cuộc trò chuyện mới, hoặc dùng phiên bản model khác, có thể ra band khác.
  • Đổi cách diễn đạt câu lệnh (prompt): yêu cầu "chấm khắt khe như giám khảo thật" so với chỉ nói "chấm bài này" có thể cho kết quả lệch nhau.
  • Không có cơ chế chấm chéo: AI không tự đối chiếu với một "giám khảo AI thứ hai" như quy trình chấm thật đôi khi áp dụng cho các bài biên giới điểm.
  • Thiếu ngữ cảnh đề bài đầy đủ: nếu không được cung cấp đúng dạng câu hỏi và yêu cầu cụ thể của đề, AI có thể đánh giá sai mức độ trả lời đề.

7. Nên dùng AI chấm Writing thế nào cho đúng

AI chấm Writing không "vô dụng" và cũng không "đáng tin tuyệt đối" — đây là công cụ có điểm mạnh và giới hạn rõ ràng. Cách dùng hợp lý:

NÊN
  • Dùng để soát lỗi ngữ pháp và từ vựng nhanh, không phải chờ đợi như gửi bài cho giáo viên.
  • Viết nhiều bản nháp, chấm lại nhiều lần trong lúc ôn để thấy mình tiến bộ ở đâu qua thời gian.
  • Dùng điểm AI như một tín hiệu tham khảo nhanh, không phải kết luận cuối cùng.
KHÔNG NÊN
  • Dùng một lần chấm AI để quyết định có đủ điểm đăng ký thi thật hay không.
  • Tin band AI đưa ra ở tiêu chí TA/TR và CC như con số cuối cùng, đặc biệt với bài gần ngưỡng band mong muốn.
  • Bỏ qua hoàn toàn việc đọc bài mẫu đã được người thật xây dựng chuẩn band, hoặc ý kiến giáo viên có kinh nghiệm khi cần quyết định quan trọng.

Muốn có bản chấm nhanh để luyện, không phải để thay giám khảo?

Tính năng chấm IELTS Writing bằng AI của IELTS 8020 cho band theo đúng 4 tiêu chí, trích ra câu sai cụ thể để sửa, kết quả trong khoảng 1 phút. Đây là công cụ hỗ trợ luyện tập để bạn thấy nhanh chỗ cần sửa — không thay thế giám khảo thật, và không nên dùng làm căn cứ duy nhất để quyết định đăng ký thi.

🤖 Thử chấm Writing bằng AI →

8. Câu hỏi nhanh (FAQ)

Chấm IELTS Writing bằng AI/ChatGPT có chính xác không?

Không tuyệt đối, nhưng có căn cứ. Nghiên cứu 2024 trên 55 bài Task 2 đo được mức khớp khá cao với giám khảo thật ở quy mô tổng thể, nhưng vẫn lệch rõ ở nhiều bài riêng lẻ — nên tác giả kết luận AI chưa nên thay giám khảo thật.

Con số "AI chấm khớp giám khảo thật khoảng 81%" lan truyền trên mạng có đúng không?

Nhiều khả năng bắt nguồn từ hệ số kappa 0.811 trong nghiên cứu trên, bị diễn giải lại thành "81% chính xác" — cách nói không hoàn toàn đúng, vì kappa đo mức đồng thuận, không phải tỷ lệ bài chấm đúng tuyệt đối.

AI có xu hướng chấm cao hơn hay thấp hơn điểm thật?

Theo quan sát không chính thức, AI thường nhỉnh hơn thực tế ở band 7 trở lên. Nhưng độ lệch có thể đi cả hai chiều — cũng có trường hợp AI chấm thấp hơn hẳn điểm thi thật.

Nên dùng AI cho tiêu chí nào trong 4 tiêu chí chấm Writing?

Hữu ích nhất với Ngữ pháp (GRA) và Từ vựng (LR) — lỗi rà được cụ thể. Với Trả lời đề (TA/TR) và Mạch lạc — Liên kết (CC), AI dễ sai vì cần đọc hiểu ngữ cảnh và lập luận.

Có nên dựa vào điểm AI chấm để quyết định đăng ký thi thật không?

Không nên dùng làm căn cứ duy nhất. Xem là tín hiệu tham khảo nhanh, kết hợp bài mẫu chuẩn band và ý kiến giáo viên có kinh nghiệm trước khi quyết định.

Vì sao điểm AI chấm không ổn định giữa các lần chấm cùng một bài?

Vì AI không qua quy trình đào tạo và kiểm định định kỳ như giám khảo thật. Đổi phiên chat, đổi model, hay chỉ đổi cách diễn đạt câu lệnh đều có thể cho band khác nhau ở cùng một bài.

Chốt lại

  • Con số "81%" nhiều khả năng bắt nguồn từ hệ số kappa 0.811 trong nghiên cứu Koraishi (2024) — mức khớp cao ở quy mô tổng thể, không phải cam kết chính xác cho từng bài.
  • AI mạnh ở GRA và LR — lỗi đếm được, chỉ ra được cụ thể.
  • AI yếu ở TA/TR và CC — cần đọc hiểu ngữ cảnh và lập luận, dễ đánh giá sai.
  • Độ lệch đi cả hai chiều — không phải lúc nào AI cũng chấm cao hơn thực tế.
  • Không dùng một lần chấm AI làm căn cứ duy nhất để quyết định đăng ký thi.

Tham khảo thêm chuẩn band thật trước khi tự đánh giá bài mình

Đọc bài mẫu Writing band 8–9 đã được xây dựng theo đúng 4 tiêu chí, để có điểm đối chiếu ngoài điểm AI chấm — miễn phí, không cần đăng nhập.

📄 Xem bài mẫu Writing band 8–9 →

Hoặc thử chấm Writing bằng AI ngay →

Nguồn tham khảo: Koraishi (2024) — Language Teaching Research Quarterly, 43, 22–42 · IELTS.org — Test statistics · IELTS Writing band descriptors

Số liệu không dẫn trực tiếp từ nghiên cứu học thuật nêu trên đều được ghi rõ trong bài là kinh nghiệm thực hành, không phải kết quả kiểm chứng độc lập. Bài viết mang tính tham khảo, không thay thế đánh giá của giám khảo IELTS thật.

← Xem tất cả bài Blog IELTS