Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents
Current researcharXiv preprint arXiv:2605.29224
AgentREVEAL diagnoses retrieval-induced safety degradation, while HarmURLBench evaluates relevance-triggered failure modes across 1,405 URLs and 320 harmful behaviours.