LVMT: Video Mask Transformer for Long-term Video Segmentation Paper • 2609.34895 • Published 10 days ago • 18
CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation Paper • 2609.06931 • Published Sep 7 • 27
Studying Image Tokenizers as Visual Languages in Unified Multimodal Models Paper • 2609.09143 • Published about 1 month ago • 29