Can AI assess writing skills like a human? A reliability analysis

dc.contributor.authorAtaseven, Hüseyin
dc.contributor.authorÇokluk Bökeoğlu, Ömay
dc.contributor.authorTaşdemir, Fazilet
dc.date.accessioned2026-09-22T07:42:29Z
dc.date.issued28 Ekim 2025
dc.departmentAfyon Kocatepe Üniversitesi
dc.description.abstractThis study investigates the reliability and consistency of a custom GPT-based scoring system in comparison to trained human raters, focusing on B1-level opinion paragraphs written by English preparatory students. Addressing the limited evidence on how AI scoring systems align with human evaluations in foreign language contexts, the study provides insights into both strengths and limitations of automated writing assessment. A total of 175 student writings were evaluated twice by human raters and twice by the AI system using analytic rubric. Findings indicate excellent agreement among human raters and high consistency across AI-generated scores, but only moderate alignment between human and AI evaluations, with the AI showing a tendency to assign higher scores and overlook off-topic content. These results suggest that while AI scoring systems offer efficiency and consistency, they still lack the interpretive depth of human judgment. The study highlights the potential of AI as a complementary tool in writing assessment, with practical implications for language testing policy and classroom pedagogy.
dc.description.abstractBu çalışma, İngilizce hazırlık öğrencilerinin yazdığı B1 düzeyindeki görüş paragraflarını değerlendirmede özel olarak yapılandırılmış GPT tabanlı bir puanlama sisteminin, eğitimli insan değerlendiricilerle karşılaştırıldığında güvenirlik ve tutarlılığını incelemektedir. Yapay zekâ tabanlı puanlama sistemlerinin yabancı dil bağlamında insan değerlendirmeleriyle ne ölçüde örtüştüğüne dair sınırlı kanıtlardan yola çıkan çalışma, otomatik yazma değerlendirmesinin güçlü ve zayıf yönlerine ışık tutmaktadır. Toplam 175 öğrenci yazısı, hem iki insan değerlendirici hem de yapay zekâ sistemi tarafından, analitik bir rubrik kullanılarak iki kez puanlanmıştır. Bulgular, insan değerlendiriciler arasında mükemmel düzeyde bir uyum ve yapay zekâ puanlamaları arasında yüksek derecede tutarlılık olduğunu; ancak insan ve yapay zekâ değerlendirmeleri arasında yalnızca orta düzeyde bir uyum bulunduğunu göstermektedir. Ayrıca yapay zekânın daha yüksek puan verme ve konu dışı içerikleri gözden kaçırma eğiliminde olduğu görülmüştür. Bu sonuçlar, yapay zekâ sistemlerinin yazma değerlendirmesinde verimlilik ve tutarlılık sağlasa da insan yargısının sahip olduğu yorumlama derinliğinden yoksun olduğunu ortaya koymaktadır. Çalışma, yapay zekânın yazma değerlendirmesinde insan değerlendirmenin yerine değil, tamamlayıcısı olarak kullanılabileceğini vurgulamakta; dil testi politikaları ve sınıf içi pedagojik uygulamalar için önemli yansımalar sunmaktadır.
dc.identifier.citationAtaseven, H., Çokluk Bökeoğlu, Ö., & Taşdemir, F. (2025). Can AI Assess Writing Skills Like a Human? A Reliability Analysis. Journal of Theoretical Educational Sciences, 18(4), 757-775. https://doi.org/10.30831/akukeg.1718511
dc.identifier.doi10.30831/akukeg.1718511
dc.identifier.endpage754
dc.identifier.issue4
dc.identifier.orcid0000-0001-9992-4518
dc.identifier.orcid0000-0002-3879-9204
dc.identifier.orcid0000-0002-0430-9094
dc.identifier.startpage736
dc.identifier.urihttps://doi.org/10.30831/akukeg.1718511
dc.identifier.urihttps://izlik.org/JA28JG35UK
dc.identifier.urihttps://dergipark.org.tr/tr/download/article-file/4954109
dc.identifier.urihttps://hdl.handle.net/11630/29067
dc.identifier.volume18
dc.language.isoen
dc.publisherAfyon Kocatepe Üniversitesi
dc.relation.ispartofKuramsal Eğitimbilim Dergisi
dc.relation.publicationcategoryMakale - Ulusal Hakemli Dergi - Başka Kurum Yazarı
dc.rightsinfo:eu-repo/semantics/openAccess
dc.subjectAutomated AI Scoring
dc.subjectWriting Assessment
dc.subjectİnterrater Reliability
dc.subjectYapay Zekâ İle Puanlama Otomasyonu
dc.subjectYazma Değerlendirmesi
dc.subjectDeğerlendiriciler Arası Tutarlılık
dc.titleCan AI assess writing skills like a human? A reliability analysis
dc.title.alternativeYapay zekâ yazma becerilerini ġnsan gibi değerlendirebilir mi? Bir güvenirlik analizi
dc.typeArticle

Dosyalar

Orijinal paket

Listeleniyor 1 - 1 / 1
Yükleniyor...
Küçük Resim
İsim:
Makale Dosyası.pdf
Boyut:
1.02 MB
Biçim:
Adobe Portable Document Format

Lisans paketi

Listeleniyor 1 - 1 / 1
Yükleniyor...
Küçük Resim
İsim:
license.txt
Boyut:
1.17 KB
Biçim:
Item-specific license agreed upon to submission
Açıklama: