A unified evaluation framework for large language models
-
Updated
Feb 20, 2026 - Python
A unified evaluation framework for large language models
A Toolbox for Adversarial Robustness Research
关于domain generalization,domain adaptation,causality,robutness,prompt,optimization,generative model各式各样研究的阅读笔记
Corruption and Perturbation Robustness (ICLR 2019)
Benchmarking Generalized Out-of-Distribution Detection
Out-of-distribution detection, robustness, and generalization resources. The repository contains a curated list of papers, tutorials, books, videos, articles and open-source libraries etc
PyBullet CartPole and Quadrotor environments—with CasADi symbolic a priori dynamics—for learning-based control and RL
Awesome-LLM-Robustness: a curated list of Uncertainty, Reliability and Robustness in Large Language Models
Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities. ACM Computing Surveys, 2026.
A curated (most recent) list of resources for Learning with Noisy Labels
Raising the Cost of Malicious AI-Powered Image Editing
A Harder ImageNet Test Set (CVPR 2021)
Code and information for face image quality assessment with SER-FIQ
Test-time Adaptation, Test-time Training and Source-free Domain Adaptation
🔥🔥🔥[AAAI 2026 Oral] Official Implementation of Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding
Diffusion Classifier leverages pretrained diffusion models to perform zero-shot classification without additional training
Adversarial attacks and defenses on Graph Neural Networks.
alpha-beta-CROWN: An Efficient, Scalable and GPU Accelerated Neural Network Verifier (winner of VNN-COMP 2021, 2022, 2023, 2024, 2025)
A curated list of trustworthy deep learning papers. Continually updating...
Benchmark your model on out-of-distribution datasets with carefully collected human comparison data (NeurIPS 2021 Oral)
To associate your repository with the robustness topic, visit your repo's landing page and select "manage topics."