LVMT: Video Mask Transformer for Long-term Video Segmentation Paper • 2609.34895 • Published 11 days ago • 19
CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation Paper • 2609.06931 • Published Sep 7 • 27
Studying Image Tokenizers as Visual Languages in Unified Multimodal Models Paper • 2609.09143 • Published Sep 8 • 29