arXiv NLP
techCenter
Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationalestranslating…
1 min readUnknownarXiv Press Group
arXiv:2608.26125v1 Announce Type: new
Abstract: Online hate against Muslim communities often appears in culturally coded, multilingual forms that evade conventional AI moderation. Such systems, though accurate, remain opaque and risk bias, over-censorship, or under-moderation…