Articles
Vibe Coding Platform Base44 Launches Proprietary AI Model Amid Startup Defensibility Push⭐7
Base44 launches its own AI model, Base1, to boost defensibility by training on user data, reducing reliance on third-party LLMs amidst growing rivalry in vibe c...
Beyond LoRA: Can You Beat the Most Popular Fine-Tuning Technique?⭐9
Can new fine-tuning methods outperform LoRA in 2026? This benchmark compares DoRA, Delta-LoRA, and prompt-based alternatives for performance, memory, and speed.
OpenAI Releases LifeSciBench: A 750-Task Benchmark for Evaluating AI Models on Real Life-Science Research with Expert-Written Rubrics⭐6
OpenAI’s LifeSciBench is a 750-task benchmark evaluating AI on real-life science research with expert rubrics, where even top models pass only ~1 in 3 tasks.
When Rules Learn: A Self-Evolving Agent for Legal Case Retrieval⭐8
A self-evolving LLM agent generates and refines query rewriting rules to enhance BM25 for legal case retrieval, outperforming static methods on LeCaRD-v2.
