arXiv Machine Learning
techCenter
NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluationtranslating…
1 min readUnknownarXiv Digital Media
arXiv:2608.26222v1 Announce Type: new
Abstract: Safety evaluation is critical for assessing whether aligned Large Language Models (LLMs) remain robust against jailbreak attacks. Existing automated testing methods, however, largely rely on response-level feedback: each candidate…