Articles

Datalab Marker v2 vs MinerU, Docling, and Liteparse: Benchmark Breakdown
ScarfBench: Benchmarking AI Agents for Enterprise Java Framework Migration
Patronus AI Secures $50M to Build ‘Digital Worlds’ That Stress-Test AI Agents
MoonMath AI Open-Sources HIP Attention Kernel for AMD MI300X: Outperforms AITER v3 Across All Shapes and Rounding Modes
OpenAI Releases LifeSciBench: A 750-Task Benchmark for Evaluating AI Models on Real Life-Science Research with Expert-Written Rubrics