CVPR 2026PastLarge language modelsComputer vision
CVPR 2026 Video LLMs Workshop
VidLLMs 2026
- Submission deadline
- Apr 24, 2026, 08:00 UTCOpenReview-synced 2026-04-24 08:00 UTC (as of 2026-06-23) — extensions on OpenReview are applied automatically; verify on the website.
- Submission portal
- OpenReview
- Notes
- Topics were auto-suggested and may be imprecise — edits welcome.
Accepted papers (18)
Fetched from OpenReview (v2) on 2026-06-10.
4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation
CausalScene: Typed Causal Scene Graphs for Counterfactual Physical Reasoning with a Path to Video LLMs
CoSeLECT: Adaptive Frame Selection for Video-Language Understanding
Evaluating Video Question Answering Multimodal Large Language Models
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
Grounding Video Reasoning in Physical Signals
Hidden Clones: Exposing and Fixing Family Bias in Vision-Language Model Ensembles
MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks
Mind the Gap: Dataset and Fine-grained Evaluation for Inline Audio Descriptions
One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition
StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
StreamReady: Learning *What* to Answer and *When* in Long Streaming Videos
Test-Time Horizon Scaling in Video LLMs via Adaptive Temporal Memory Compression
TimeBlind: A Spatio-Temporal Compositionality Benchmark for Video LLMs
VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models
VideoCritic: Diagnosing and Localizing Reasoning Errors in Video-Language Models
VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition
VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models