#benchmark

Benchmark: 23 AI articles covering benchmark news, analysis, and research

Articles

EvalDetectBench: A Benchmark for Measuring Evaluation Awareness in Frontier Language Models
Anthropic Unveils Fable 5.1: Enhanced Performance at Lower Cost and Reduced Restrictions
Keenable AI Open-Sources NEEDLE: A Live Search Benchmark That Rebuilds Its Query Set Every Hour
Time Capsule of Testable Human Knowledge: 41 Years of Jeopardy! in a Single Free Local Model
Lowest-Latency Inference APIs for Voice and Realtime Agents: A Time to First Token (TTFT)-First Benchmark
Modality Maturity Index: A Benchmark for Assessing Multimodal Capabilities of Omni Models
DeflectBench: A Benchmark for Evaluating Rhetorical Fallacy Generation in LLMs
OpenAI Unveils Jalapeño Chip, Claiming Faster AI Inference Than Nvidia
Travis Kalanick Reignites VC Criticism: 'Only 1% Are Truly Helpful'
Diagnostic Foundation for Evaluating LLMs' Research Integrity as