0 "evaluation" Awesome Lists
awesome-semantic-segmentation
:metal: awesome-semantic-segmentation
benchmark deeplearning evaluation semantic-segmentation
10,849 stars
2,466 forks
53 projects
Last updated: 22 Jul 2026
Awesome-LLM-Long-Context-Modeling
📰 Must-read papers and blogs on LLM based Long Context Modeling 🔥
agent awsome-list benchmark blogs compress evaluation large-language-models length-extrapolation llm long-context-modeling
2,163 stars
102 forks
318 projects
Last updated: 17 Aug 2026
awesome-llm-eval
Awesome-LLM-Eval: a curated list of tools, datasets/benchmark, demos, leaderboard, papers, docs and models, mainly for Evaluation on LLMs. 一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表,主要面向基础大模型评测,旨在探求生成式AI的技术边界.
awsome-list awsome-lists benchmark bert chatglm chatgpt dataset evaluation gpt3 large-language-model
656 stars
87 forks
479 projects
Last updated: 30 Aug 2026
awesome-llm-unlearning
A resource repository for machine unlearning in large language models
ai-safety alignment awesome awesome-list evaluation knowledge-erasure large-language-model llm llm-safety llm-unlearning
618 stars
32 forks
770 projects
Last updated: 27 Jul 2026
Awesome-Evaluation-of-Visual-Generation
A list of works on evaluation of visual generation models, including evaluation metrics, models, and systems
awesome benchmark evaluation evaluation-metrics evaluation-system generative-models image-generation video-generation
454 stars
25 forks
2,052 projects
Last updated: 11 Jul 2026
awesome-ai-leaderboard
A curated list of awesome leaderboard-oriented resources for AI domain
ai-agent artificial-intelligence awesome-list benchmark deep-learning evaluation foundation-model large-ai-model leaderboard machine-learning
373 stars
58 forks
568 projects
Last updated: 31 Jul 2026
awesome-data-contamination
The Paper List on Data Contamination for Large Language Models Evaluation.
awesome-list data-contamination evaluation foundation-models large-language-models llm paper-list pre-trained-language-models pre-trained-model
119 stars
6 forks
268 projects
Last updated: 11 Aug 2026
awesome-ai-eval
☑️ A curated list of tools, methods & platforms for evaluating AI reliability in real applications
ai-evaluation ai-evaluation-framework ai-evaluation-metrics ai-evaluation-tools awesome awesome-list awesome-lists chatgpt claude evaluation
103 stars
28 forks
186 projects
Last updated: 07 Aug 2026
awesome-ai-agent-testing
🤖 A curated list of resources for testing AI agents - frameworks, methodologies, benchmarks, tools, and best practices for ensuring reliable, safe, and effective autonomous AI systems
agent-evaluation agentic-ai ai-agents ai-benchmark ai-safety artificial-intelligence awesome-list benchmark chaos chaos-engineering
46 stars
16 forks
168 projects
Last updated: 12 Aug 2026
awesome-datacentric-llm
Trending projects & awesome papers about data-centric llm studies.
data-centric-ai evaluation llm pre-training
40 stars
2 forks
45 projects
Last updated: 07 Feb 2026
Awesome-AI-Engineering
A full-stack LLM engineering playbook- practical guides for building, deploying, and evaluating LLM systems and AI agents.
agents ai-infrastructure deep-learning evaluation evaluation-framework fine-tuning langchain llm machine-learning mcp
13 stars
1 forks
71 projects
Last updated: 06 Aug 2026
awesome-agent-rl-environments
A curated list of training & evaluation environments for LLM/VLM agents (SWE-Gym, GEM, RAGEN, AgentGym, WebArena, OSWorld, ToolBench…). Updated weekly.
agent agent-rl agentic-ai awesome awesome-list benchmark browser-agent computer-use-agent evaluation grpo
7 stars
1 forks
70 projects
Last updated: 16 Aug 2026