Paper Everyday
One AI research paper, explained clearly — every single day. Skip the jargon, get the insight.
Category
Computer Vision and Pattern Recognition(27 papers)
TempCloze: Can Video-LLMs Identify the Missing Middle?
Wenqi Pei +6 more
FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation
Vladislav Bargatin +3 more
Mi-Ripple: Restoring Images Degraded by Iterative AI Editing
Jiayin Chen +2 more
SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem
Soohyun Ryu +2 more
SenseNova-U1.5: Towards Native Unified Visual Intelligence
Haiwen Diao +64 more
TransNormal-2: Geometry-Grounded Rectified Flow with Edge-Aware Decoding for Precise Normal Estimation
Mingwei Li +2 more
CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs
Nhat-Tan Bui +9 more
Agentic Visual Generation: From Generative Models to Agentic Control
Yinming Huang +9 more
Mask Forcing: Improving Autoregressive Video Diffusion Distillation via Dual-Noise Masking Rollout
Zhuoran Zhao +9 more
SceneMosaic: Efficient and Diverse Simulation-Ready Scene Generation via Hybrid Agentic Layout Evolution
Xingjian Ran +5 more
Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation
Igor Pavlovic +8 more
DriveZero: End-to-End Driving Beyond Human Demonstrations
Hao He +19 more
ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation
Javier del Pino +4 more
AdaptVPR: Route-Aware Hard Positive Generation for Robust Visual Place Recognition
Shunpeng Chen +8 more
To See a World in a Living Context: Unified Indoor-Outdoor Urban World Generation
Xiaobin Huang +5 more
ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding
Jitai Hao +3 more
WorldSculpt: Generating Compositional Worlds from Grounded Videos
Muyao Niu +11 more
TorchMorph: CUDA-accelerated Morphological Transforms
Kai Zhao
MoTE: Mixture of Task Experts for Multi-Task Video Understanding
Muhammad Asad Ali +3 more
LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
Andreas Hochlehnert +11 more
From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms
Jiangning Zhang +2 more
Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training
Wenxuan Shen +2 more
On-Policy Self-Distillation in Diffusion Models
Wei Zhou +16 more
WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report
Junjie Zhou +5 more
Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
Yunheng Li +6 more
EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment
Guray Ozgur +3 more
Tomatoes, Potatoes, and Onions: Questioning the Need for Faces in Face Presentation Attack Detection
Guray Ozgur +2 more
Category
Artificial Intelligence(22 papers)
HyQuant: Hybrid-Precision Quantization for LLM Attention
Jiatong Ding +11 more
An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics
Ivan Moshkov +5 more
Procedural Graphs: Self-Evolving Execution Structures for LLM Agents
Yuxing Lu +3 more
Reason Through the Latent! Making Latent Visual Reasoning Necessary
Suhyeong Park +2 more
When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference
Ismail Erbas +2 more
τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction
Quan Shi +3 more
MaxKernel: Agentic Kernel Generation for TPUs
Shangkun Wang +9 more
RISE: Recursive Improvement via Self-Extrapolating Policy Distillation
Yang Li +2 more
Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference
Mostafa Elhoushi +8 more
The Attention Triangle in Audio-Video Models
Sagi Polaczek +6 more
Iris: Climbing to the Search Frontier
Ziyuan Liu +8 more
Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems
Yihang Chen +5 more
Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment
Stephen Chung +2 more
CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
Boyang Liu +17 more
When "Must" Becomes "Maybe": Constraint Weakening in LLM Agent Workflows
Yiheng Sun +5 more
Automata from Agent Traces: Failure and Next-Step Prediction
Seonglae Cho +6 more
AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace
Seonglae Cho, Donghyun Lee
Meta^n: Recursive Self-Improvement through Emergent Depth
Zae Myung Kim +3 more
Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
Zhaochen Yu +7 more
AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
Sungho Park +12 more
ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts
YuanHang Xiao
From Generation to Simulation: How Far Are World Models from Being True Simulators?
Tong Wang +5 more
Category
Machine Learning(19 papers)
Beyond Solver Verdicts: Generative Reward Models for Autoformalization
Vikash Singh +7 more
MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes
Remco Hendriks
Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks
Hongbang Yuan +2 more
Kalman Delta Networks: Uncertainty-aware Associative Memory
Ngoc Bui +2 more
Online Draft Co-Training for Speculative Decoding in Large-Scale, Long-Context RL Post-Training
Zili Wang +4 more
Miles v0.1: Production-Level Post-Training
RadixArk +12 more
BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference
Janghyeon Kim +3 more
Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation
Youngrok Park +8 more
Causal Foundation Models
Christopher Stith +2 more
Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation
Zhiwei Zhang +8 more
One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation
Justin Robert, Raheel Qader
FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience
Zixun Huang +3 more
Unlocking Lossless Speedups in LLMs via Discrete Diffusion
Subham Sekhar Sahoo +16 more
Group Adaptive Clipping Policy Optimization
Sheng Jia +3 more
On-policy Distillation with Verifiable Reward
Wenze Lin +7 more
Best Practice Critic Optimization
Penghui Qi +2 more
What AstroPT knows about galaxies, and what that can teach us about LLMs
UniverseTBD +4 more
Hybrid Quantum-inspired Kolmogorov-Arnold Networks for Privacy-Aware Federated Biosignal Learning
Chun-Hua Lin +9 more
RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA Modeling
Ziyuan Wang +4 more
Category
Robotics(11 papers)
Memory as Plans: World-Action Modeling with Memory-Grounded Planning
Sizhe Zhao +7 more
Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy
Ayoub Kirouane +2 more
TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model
Anqi Li +6 more
RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?
Zhenxuan Fan +11 more
CosmoH2G: A Hand-to-Gripper Transfer Dataset and Baseline Method for Object Manipulation with Complex Spatial Movements
Hongxiang Zhao +5 more
GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
AgiBot Research Team +44 more
OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining
Yuran Wang +23 more
EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents
Wei Wang +16 more
Latent Action as Intention Enables Efficient Future Imagination for World Action Models
Xiang Li +12 more
GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
GigaBrain Team +58 more
WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning
Chunkai Yang +2 more
Category
Computation and Language(10 papers)
Negative Self-Distillation: Learning to Reason by Avoiding Flaws
Rongcan Pei +5 more
NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
NCP Team +27 more
Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs
Seogyeong Jeong +5 more
Steering Geometry: Validating Human Value Geometry in LLM Steering Space
Mohammad Mahdi Abootorabi +7 more
NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness
NeoHorse Team +36 more
What Else Needs Fixing? Exploring Cost-Effective Test-Time Compute for Revision Propagation in Artifacts Generated Through Conversation
Daisuke Kikuta
Unifying Conformal Language Tasks with In-Context Ensembles
Xiao Shi Huang +4 more
Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal
Alejo López-Ávila +4 more
Enoki: Efficient Multi-Level Hallucination Detection
Elisei Rykov +7 more
Length-Adaptive Decoding for Masked Diffusion Machine Translation
Yan Zhan +3 more
Category
Sound(3 papers)
X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation
Haojun Zhang +9 more
AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing
Ziyang Ma +32 more
Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue
Chengqian Ma +3 more
Category
Cryptography and Security(3 papers)
EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents
Nanxi Li +6 more
CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild
Jian Yang +10 more
SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation
Yibo Peng +3 more
Category
Audio and Speech Processing(2 papers)
Training-Free Speech-Centric Omni Understanding with Frozen VLMs
Ankan Deria +4 more
Omni Interaction Agent Technical Report
Orantqing +22 more
Category
Optimization and Control(1 paper)
Category
Software Engineering(1 paper)
Category