LIVE-Last scan updating-53 sources active-870 signals today-RESEARCH PVBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
Research radar

arXiv preprints, filtered for developer impact.

Concise summaries of new AI papers, ranked for how likely they are to change how production systems are built. arXiv collection remains rate-limited.

Papers tracked
2,287
matching records
Shown
10
current page
Top radar
86
http://arxiv.org/abs/2608.26086v1
Code links
2
on this page
PaperAuthorsarXiv IDCategoriesPublishedCodeRadarSummary
TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning DevelopmentJiarui Yan, Weiwei Sun, Sijie Lihttp://arxiv.org/abs/2608.26086v1cs.LG, cs.AIAug 26, 2026DetectedRDR86Large language models write correct code for isolated problems but remain far weaker at auton...
WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill EvolutionLiyan Tang, Cyrus Rashtchian, Chun-Sung Fernghttp://arxiv.org/abs/2608.27454v1cs.AI, cs.CLAug 27, 2026NoneRDR75Agent skills package specialized knowledge and workflows into reusable resources that extend...
SWE-Prime: Fewer Trajectories, Better PerformanceDewu Zheng, Ruizhe Ye, Yanlin Wanghttp://arxiv.org/abs/2608.27449v1cs.SE, cs.AIAug 27, 2026NoneRDR81To improve large language models' ability to resolve real-world software issues, prior work h...
From Static to Dynamic: Benchmarking Real-World Code Review with MCR-BenchDewu Zheng, Yanlin Wang, Xiwen Wanghttp://arxiv.org/abs/2608.27442v1cs.SE, cs.AIAug 27, 2026NoneRDR81In real-world software development, code review typically involves iterative interactions bet...
Beyond F1: Evaluating Coverage and Failure Recovery in AI Model Security ScannersQianlong Lan, Vinothini Pandurangan, Anuj Kaulhttp://arxiv.org/abs/2608.27424v1cs.CR, cs.AIAug 27, 2026NoneRDR82Static scanners are increasingly used to identify executable or otherwise unsafe content in m...
Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion ParadigmsSiye Wu, Kai Yang, Yuchen Caihttp://arxiv.org/abs/2608.27409v1cs.CLAug 27, 2026NoneRDR80Reinforcement learning with verifiable rewards (RLVR) improves specific capabilities of large...
CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge BasesSil Hamilton, Albert Yu Sun, Oscar J. Romerohttp://arxiv.org/abs/2608.27391v1cs.AI, cs.CLAug 27, 2026NoneRDR87LLMs are increasingly able to answer complex questions about enterprise-scale document collec...
D2C-Routing: Dimension-to-Composition Evidence Routing for Mixed-Origin AI-Generated Text DetectionXin Chen, Fuwei Zhang, Yiqi Tonghttp://arxiv.org/abs/2608.27380v1cs.CLAug 27, 2026DetectedRDR86AI-generated text detection is commonly framed as a binary document-level judgment about whet...
VBVR-Pro: A Scalable and Verifiable Suite for Native Visual ReasoningJunxiang Xu, Ruisi Wang, Fanyi Puhttp://arxiv.org/abs/2608.26105v1cs.CV, cs.AIAug 26, 2026NoneRDR86Native visual reasoning treats visual generation as the medium of reasoning itself: visual st...
TTPO: Test-Time Policy OptimizationAozhe Wang, Zhengxi Lu, Jianze Wanghttp://arxiv.org/abs/2608.27448v1cs.CLAug 27, 2026NoneRDR74Recent prominent post-training methods, such as Reinforcement Learning (RL) and On-Policy Sel...