The Implications of Linguistic Illegibility for LLM Security
A paper argues that linguistic illegibility makes LLM self-reporting unreliable for security, advocating for taint tracking in model sandboxes.
Why it matters: LLM internal computations are not directly expressed via language.





