Benchmarks for large language models are outdated due to evolving jailbreak techniques. Jailbreak Foundry introduces a reproducible benchmarking method to address this issue. This affects model robustness estimates and comparisons across papers.
STATUS
ACTIVE
CATEGORY
Models
SOURCES
1 linked
ENTITIES
2 detected
OVERRIDE
Automated
MOMENTUM
3 days ago