LLMs

Latest breakthroughs in Large Language Models

Articles

Does a Language Server Save Tokens for Coding Agents? A
Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting
The Alignment Community Is Unintentionally Building a Censor's Toolkit
Diagnostic Foundation for Evaluating LLMs' Research Integrity as
Position: Reasoning is a Learnable Rule-Based Process
TRACE Bench: Task-Driven Roleplay Agentic Checklist Evaluation
Retrofitting Recurrent Depth into a Pretrained Language Model:
Distribird: Literature-Informed Prior Distribution Design for
Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading
Dynamic Governance of Multi-LLM Agent Systems for Collaborative