arXiv:2610.02432v1 Announce Type: new Abstract: Large language models (LLMs) in production systems face prompt injections, trojans (backdoors), and manipulation of automatic quality metrics. This thesis develops models, methods, and algorithms for evaluating and improving LLM robustness to adversarial input sequence variations.

Read the full article at arXiv cs.CR →