0 "llm-evaluation" Awesome Lists
awesome-evals
A curated, non-BS library of the best resources for building and evaluating AI agents — papers, blogs, talks, tools, benchmarks. Maintained by BenchFlow.
agent-evaluation ai-agents awesome awesome-list benchmarks evals llm llm-evaluation rl-environments
683 stars
49 forks
383 projects
Last updated: 07 Jul 2026
awesome-llm-eval
Awesome-LLM-Eval: a curated list of tools, datasets/benchmark, demos, leaderboard, papers, docs and models, mainly for Evaluation on LLMs. 一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表,主要面向基础大模型评测,旨在探求生成式AI的技术边界.
awsome-list awsome-lists benchmark bert chatglm chatgpt dataset evaluation gpt3 large-language-model
647 stars
76 forks
479 projects
Last updated: 26 Jun 2026
awesome-datasets-hub
A curated collection of datasets for Large Language Models (LLMs), covering medical AI, NLP, multimodal learning, instruction tuning, reasoning, code generation, and evaluation benchmarks.
benchmark benchmarking deep-learning deep-neural-networks deeplearning genetic-algorithm llm llm-evaluation llm-inference machine-learning
142 stars
39 forks
595 projects
Last updated: 30 Jun 2026
awesome-ai-agent-testing
🤖 A curated list of resources for testing AI agents - frameworks, methodologies, benchmarks, tools, and best practices for ensuring reliable, safe, and effective autonomous AI systems
agent-evaluation agentic-ai ai-agents ai-benchmark ai-safety artificial-intelligence awesome-list benchmark chaos chaos-engineering
40 stars
13 forks
168 projects
Last updated: 13 Jun 2026
awesome-ai-agent-evaluation
A curated list of benchmarks, eval harnesses, papers, datasets, and production checks for AI agents.
agent-benchmark agent-evaluation ai-agents ai-evaluation awesome benchmarks coding-agents evals llm-agents llm-evaluation
1 stars
1 forks
141 projects
Last updated: 30 May 2026
ai-llmops-index
Comprehensive LLMOps reference index: observability platforms, inference cost intelligence, failure mode taxonomy, stack compatibility matrices, and regulatory compliance mapping for LLMs in production.
ai-compliance ai-governance ai-infrastructure ai-observability ai-safety awesome-list llm-benchmarks llm-cost-comparison llm-evaluation llm-failure-modes
1 stars
0 forks
95 projects
Last updated: 12 Mar 2026