LUTSeg: A Longitudinal Multi-Expert Dataset for Ulcer Tissue Segmentation Paper • 2608.25866 • Published 11 days ago • 1
DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization Paper • 2608.17067 • Published 20 days ago • 21
QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation Paper • 2604.08570 • Published Mar 25 • 126
AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models Paper • 2511.14295 • Published Nov 18, 2025 • 74
Reasoning Vectors: Transferring Chain-of-Thought Capabilities via Task Arithmetic Paper • 2509.01363 • Published Sep 1, 2025 • 62
Multimodal Safety Evaluation in Generative Agent Social Simulations Paper • 2510.07709 • Published Oct 9, 2025 • 13