{"as_of":"2026-08-11T06:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e412a681b8c533141747f27e3aa3257c11c2d03035ebcf2eaf89d35419d5eb92","coverage":[{"denominator":122,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T00:44:49.747631Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14935/citation-record","integrity":"/paper/2607.14935/integrity","json":"/paper/2607.14935/citation-record.json","paper":"/paper/2607.14935"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T00:44:40.263863Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:40.263863Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:cae1b68f542808a67721f4b4839af42f6b57a6884f24aecba1b2b7be5acd2f77","observation_id":"4a5ccee9-7d80-4eb4-980c-aedb59733c49","resolution":{"observed_at":"2026-08-02T00:44:40.263863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-02T00:44:40.385436Z","title":"Internvideo2.5: Empowering video mllms with long and rich context modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:40.385436Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:d60bd7dfd11e04c24ff8b9dc41c34cab1b0f461365a0b0d972e4817ab1c5933e","observation_id":"dbcfc400-3eab-4288-add5-b74a12a64c15","resolution":{"observed_at":"2026-08-02T00:44:40.385436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-02T00:44:40.495393Z","title":"Videochat-flash: Hierarchical compression for long-context video modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:40.495393Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:cead89e4ab0f17348c295f7c9787fb8918c4d7ba37f1db640a57663004f8246d","observation_id":"e7e61b8a-07a7-4a88-98f4-a78be078cb89","resolution":{"observed_at":"2026-08-02T00:44:40.495393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-07T23:47:53.537198Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-02T00:44:40.660990Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:40.660990Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:1b8af0e2c85fd87cb44f49f5b2cf9ebf887a86e8bac00ba4d2e6024924dae198","observation_id":"e667046c-a725-4642-b587-c2328b08047c","resolution":{"observed_at":"2026-08-02T00:44:40.660990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.10611","snapshot_observed_at":"2026-08-02T00:44:40.771026Z","title":"Molmo2: Open weights and data for vision-language models with video understanding and grounding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:40.771026Z"},"links":{"cited_paper":"/paper/2601.10611","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:aae8ee81567611bd98b099e5c708f45cd06337a3b16477b15db019b4b4283515","observation_id":"89442b5b-01c1-4281-b165-e4ae54133cd4","resolution":{"observed_at":"2026-08-02T00:44:40.771026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-02T00:44:40.831039Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:40.831039Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:bfca83d5a2e3ecbdc49de679fb7cb815806f8e12ec089118993704c011e18880","observation_id":"ef734fdc-7083-4879-a6ff-04ef4bbef4a0","resolution":{"observed_at":"2026-08-02T00:44:40.831039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T00:44:40.939379Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:40.939379Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:d4e49bebea6b62a3cbc79986db7eb5848afb7cbc38283ab8582629ae1138e375","observation_id":"b3002662-927d-4f41-84b7-8cd3dfe506a1","resolution":{"observed_at":"2026-08-02T00:44:40.939379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:41.103975Z","title":"Videochat-r1","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.103975Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:205c90bcc76de7fa43103065c366cd4309cbc7f55c0d7157c299128249fad8bd","observation_id":"48755b6a-f903-4acc-923a-ccfe3364939c","resolution":{"observed_at":"2026-08-02T00:44:41.103975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19225","snapshot_observed_at":"2026-08-02T00:44:41.162135Z","title":"Video-xl-2: Towards very long-video understanding through task-aware kv sparsification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.162135Z"},"links":{"cited_paper":"/paper/2506.19225","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:05a4bb511fd37321a41056c1a47edafbb6d6d1a2c4718e7c91ee00538eef1e2c","observation_id":"7e95a7ad-809f-46f5-8825-6b314a59a3ec","resolution":{"observed_at":"2026-08-02T00:44:41.162135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.23224","last_updated":"2026-05-21T09:05:36Z","snapshot_observed_at":"2026-08-02T12:29:31.448544Z","submitted_at":"2026-01-30T17:47:30Z","title":"Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.23224","snapshot_observed_at":"2026-08-02T00:44:41.221547Z","title":"Video-o3: Native interleaved clue seeking for long video multi-hop reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.221547Z"},"links":{"cited_paper":"/paper/2601.23224","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:31d6818869ad75b6668c065eed2403cf02e0bc43b653863c00db6de97520bae1","observation_id":"7eb20e68-e4ab-472d-83e9-bc2fcebe7712","resolution":{"observed_at":"2026-08-02T00:44:41.221547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01805","snapshot_observed_at":"2026-08-02T00:44:41.291479Z","title":"Spacer: Reinforcing mllms in video spatial reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.291479Z"},"links":{"cited_paper":"/paper/2504.01805","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:52a3fc6dd901d123e53ffc2b548fe31d2cf8c74625321be8eb48ba27ae1e82a6","observation_id":"6a14c559-b0a9-4999-89b1-aa7072fa0657","resolution":{"observed_at":"2026-08-02T00:44:41.291479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:41.382976Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.382976Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:8108a641982f1e37a89cbbfc58e7d15bc2ec861ac2be3a68df53875764e4152b","observation_id":"3971ffea-3617-48e5-a5ad-d0b190556c65","resolution":{"observed_at":"2026-08-02T00:44:41.382976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:41.430131Z","title":"Timesuite: Improving mllms for long video understanding via grounded tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.430131Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:76a56c05c3799f917c3028f8889af9c092958d9fa7c035de35377a6afca93e27","observation_id":"896580a9-b2dd-4e5f-928b-d905b606de14","resolution":{"observed_at":"2026-08-02T00:44:41.430131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:41.491845Z","title":"Timelens: Rethinking video temporal grounding with multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.491845Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:4e816bc975ad8d019cf82a6c38f11286bedef176e4df14ffe5654e0a256066bb","observation_id":"9ee61b8d-42f9-49b3-bdf3-4d68bfebf8cd","resolution":{"observed_at":"2026-08-02T00:44:41.491845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:41.520198Z","title":"Videollm-online: Online video large language model for streaming video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.520198Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:d69d51ae38600884d1ef9026c6ff6c40ff273ca565a93f884ad0b6dbe5080ab2","observation_id":"a97708be-9b01-4dac-b427-131bd70fac0e","resolution":{"observed_at":"2026-08-02T00:44:41.520198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-03T12:09:02.990658Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-08-02T00:44:41.589936Z","title":"Flash-vstream: Memory-based real-time understanding for long video streams","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.589936Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:85bd704be1921e6b05091cd3882a3da35cce13b146c4bd4ca095eb0abe11081d","observation_id":"7e5440df-9915-40ca-8717-78f8973438bf","resolution":{"observed_at":"2026-08-02T00:44:41.589936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:41.682216Z","title":"Online video understanding: Ovbench and videochat-online","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.682216Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:7999f3ab78856ad684622831771c74e7eceb488fdb999d54af9ba3a91ed1db26","observation_id":"1a369fec-b7b9-4308-81b4-7288778b1d35","resolution":{"observed_at":"2026-08-02T00:44:41.682216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:41.752189Z","title":"Dispider: Enabling video llms with active real-time interaction via disentangled perception, decision, and reac- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.752189Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:60e1fbc0dc65ff29cbafdb8304f34ccbb1fda7b9aa36fe993cb1d9ca2f9bc8d1","observation_id":"cd5440ab-3792-4d09-8638-349f095ca67a","resolution":{"observed_at":"2026-08-02T00:44:41.752189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:41.822857Z","title":"Streamforest: Eﬀicient online video understanding with persistent event memory","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.822857Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:b912dfaa014f31fda47bf066f44f256e02f35649cc0dd697eeadf3132a941f72","observation_id":"98d24d20-5989-423a-807d-fd5b57368f76","resolution":{"observed_at":"2026-08-02T00:44:41.822857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21334","last_updated":"2026-04-10T15:00:46Z","snapshot_observed_at":"2026-08-03T08:10:30.527963Z","submitted_at":"2025-12-24T18:59:36Z","title":"Streaming Video Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.21334","snapshot_observed_at":"2026-08-02T00:44:41.892453Z","title":"Streaming video instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:41.892453Z"},"links":{"cited_paper":"/paper/2512.21334","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:434d4c6c93934da56dcc3a5b8540decae47d45215c5c8789066d2529babc53ae","observation_id":"8e546c26-dd84-4100-afa7-2c56326fc8b1","resolution":{"observed_at":"2026-08-02T00:44:41.892453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:42.000829Z","title":"Streambridge: Turning your offline video large language model into a proactive streaming assistant","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:42.000829Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:375053051198eccc0485b21d32faab919606900e43a5a103bdc16a97c6fad7b5","observation_id":"993fd87c-d1d1-4a9c-9cb8-d355b9fc2d39","resolution":{"observed_at":"2026-08-02T00:44:42.000829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:42.058308Z","title":"Gemini 3: News and announcements","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:42.058308Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:4d9216145c425f806080618944eec13cf11c1a2c41676a6293dc5875858c2705","observation_id":"84c47551-8d13-4eb5-afe6-0ea131a643b8","resolution":{"observed_at":"2026-08-02T00:44:42.058308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-02T00:44:42.146048Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:42.146048Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:d6ca2c457770178af7c87cbafc7e93ec603803dd7d7b14c8b39eea1b01e6bcd8","observation_id":"cdfce8b2-b132-4d59-be38-3009f0e0f2bf","resolution":{"observed_at":"2026-08-02T00:44:42.146048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.20633","last_updated":"2026-04-17T08:57:17Z","snapshot_observed_at":"2026-07-06T22:49:57.103822Z","submitted_at":"2026-03-21T04:03:45Z","title":"Seed1.8 Model Card: Towards Generalized Real-World Agency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.20633","snapshot_observed_at":"2026-08-02T00:44:42.258052Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:42.258052Z"},"links":{"cited_paper":"/paper/2603.20633","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:b13dbab53c9aa91efad65a4e1bededfe294e1f1f8ca1ccfc802af0e1c3cc2492","observation_id":"f292ffb8-0f86-4e74-879e-f18ccb366a37","resolution":{"observed_at":"2026-08-02T00:44:42.258052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:42.442107Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:42.442107Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:29a14496a7199f77a00f30f6327de3814ebaa38338fae734d1ae26344517c3c4","observation_id":"e387c711-e657-4b7c-89db-b3d318a62123","resolution":{"observed_at":"2026-08-02T00:44:42.442107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:42.626276Z","title":"Llava-video: Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:42.626276Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:17005ca2da0722d62cc3481b8525af1c0ae7331426a187c89a1c72faea2a61f6","observation_id":"68902810-0686-4fd3-a7f9-7b0fbb7bfd67","resolution":{"observed_at":"2026-08-02T00:44:42.626276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:42.674221Z","title":"Spoken moments: Learning joint audio-visual representations from video descriptions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:42.674221Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:c9e60f9c6b6799d7d432d1fab1c4c3197000169fd46cbc8bacc8459681489473","observation_id":"f310e039-88e8-4489-a3f5-4b83df3475d5","resolution":{"observed_at":"2026-08-02T00:44:42.674221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06040","last_updated":"2024-10-25T06:32:09Z","snapshot_observed_at":"2026-07-06T18:27:58.433967Z","submitted_at":"2024-06-10T06:17:55Z","title":"Vript: A Video Is Worth Thousands of Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06040","snapshot_observed_at":"2026-08-02T00:44:42.744544Z","title":"Vript: A video is worth thousands of words, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:42.744544Z"},"links":{"cited_paper":"/paper/2406.06040","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:965d5c3de061c28d797cf68ca0a1e25109a2a0b81aaa9409a9389d60bae352ab","observation_id":"696b1e40-7be9-4046-870a-3400740071da","resolution":{"observed_at":"2026-08-02T00:44:42.744544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-02T00:44:42.862348Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:42.862348Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:a0eb73cac866c9fae1b808166e60916969a2b40b9951aa661313a8f163625dc4","observation_id":"348f95ff-4641-4035-9846-921b4270211e","resolution":{"observed_at":"2026-08-02T00:44:42.862348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:42.961347Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:42.961347Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:9465814ffc073556e3aa453a2939d1687d41817afccfb08f0aab15495bfac631","observation_id":"7ad1ffdd-369f-409c-b585-466a4e9b6ca0","resolution":{"observed_at":"2026-08-02T00:44:42.961347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:43.030845Z","title":"Caprl: Stimulating dense image caption capabilities via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.030845Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:063aa813ccef632553fc58d83008c56dfdfdbd35c13e43f43a0e8d3c3da95ed9","observation_id":"1fbbbd9f-5d8a-48f9-8681-349e8f704aba","resolution":{"observed_at":"2026-08-02T00:44:43.030845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-02T00:44:43.081065Z","title":"Sharegpt4v: Improving large multi-modal models with better captions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.081065Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:9d3cf94ac52dc2e43cb44cb17833844e625072dd4e5865d89ef8159f80334adf","observation_id":"fc39791f-29a1-412a-8774-f3fba5cbe5e9","resolution":{"observed_at":"2026-08-02T00:44:43.081065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:43.181761Z","title":"Densefusion-1m: Merging vision experts for comprehensive multimodal perception, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.181761Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:9538dd99a164a8dbdcc0156219aa42d38c894dca80b34c104acf034485589bd0","observation_id":"adf665ae-a5d2-46df-a260-54c49dd84a5f","resolution":{"observed_at":"2026-08-02T00:44:43.181761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:43.251365Z","title":"Conceptual captions: A cleaned, hyper- nymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.251365Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:ca4fe6f85d3af982310fe9f6c070272de2d3f7f467151f02a7d3940c510c9d42","observation_id":"2e086231-e4f4-4f51-b110-bb8fb79de085","resolution":{"observed_at":"2026-08-02T00:44:43.251365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:43.345486Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.345486Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:72ecde89fc00fe2f782ac843baa8db05d60317fc141404209dccc5ccfd08a37e","observation_id":"04b79d1e-0edf-457b-bda4-415a13500e9f","resolution":{"observed_at":"2026-08-02T00:44:43.345486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-02T00:44:43.450847Z","title":"The kinetics human action video dataset, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.450847Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:c6e3f9eb4e7ba3064c8a3050aa93d302a2122d43ce83fa9cd7012f03c02c8864","observation_id":"5f1b7b9b-5867-4fee-917d-998c90074fef","resolution":{"observed_at":"2026-08-02T00:44:43.450847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13181","snapshot_observed_at":"2026-08-02T00:44:43.511377Z","title":"Perception encoder: The best visual embeddings are not at the output of the network, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.511377Z"},"links":{"cited_paper":"/paper/2504.13181","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:c6a09f9b7e1bab59779dc627b6b3ed98324e79dedcacdc123870c57a698d8af3","observation_id":"9070223b-b3a6-407a-930f-bb3cadac97ad","resolution":{"observed_at":"2026-08-02T00:44:43.511377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-10T20:27:34.844428Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-02T00:44:43.581545Z","title":"Tarsier2: Advancing large vision- language models from detailed video description to comprehensive video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.581545Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:e73bbf7e007c73ba73fe19d10f639361594d6d9e1e4906f12e470c6d1dabdcda","observation_id":"dc8bdbe5-db5f-4970-bc1b-09f5f5777cae","resolution":{"observed_at":"2026-08-02T00:44:43.581545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.03705","last_updated":"2016-05-12T07:34:08Z","snapshot_observed_at":"2026-08-09T13:48:57.818133Z","submitted_at":"2016-05-12T07:34:08Z","title":"Movie Description","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.03705","snapshot_observed_at":"2026-08-02T00:44:43.651420Z","title":"Movie description, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.651420Z"},"links":{"cited_paper":"/paper/1605.03705","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:be97bf067042c78856a8fd9481b922c2ebb0735dd0eaa9a96dc4b8678e3d42b4","observation_id":"97b1d4bd-f720-4045-b127-9119a204ce99","resolution":{"observed_at":"2026-08-02T00:44:43.651420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:43.802803Z","title":"Vatex: A large-scale, high-quality multilingual dataset for video-and-language research, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.802803Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:c6d465c4b39d2e1e7ade99dbc396238a6c247cb7330acaa2494cca2012be8ad3","observation_id":"2487f5b2-24d7-41e8-9d0e-57d5915cece2","resolution":{"observed_at":"2026-08-02T00:44:43.802803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:43.836826Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.836826Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:0770223ac2e6aaed2f2aac8df77727503db57df846ec39484f487b9409e78140","observation_id":"5d1616b3-84c4-4329-b3fc-b43ea5e67a88","resolution":{"observed_at":"2026-08-02T00:44:43.836826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:43.888588Z","title":"Hollywood in homes: Crowdsourcing data collection for activity understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.888588Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:39ee94ae2cc7c01b7b440d65491931b641164ab1ca2f4d262173802263c580e8","observation_id":"b3a2e685-6b4c-491d-acd5-1ad19717cea8","resolution":{"observed_at":"2026-08-02T00:44:43.888588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:43.944633Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:43.944633Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:e4a290fe65f8865618d1b6bd6ac3425d64b7e8f882f2375751dee39675233a74","observation_id":"2722b1ba-4233-4f03-834d-c6f0f5029497","resolution":{"observed_at":"2026-08-02T00:44:43.944633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:44.014790Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:44.014790Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:9f34031bf95401443af66eded18153924935e125517485072731717f8cec0316","observation_id":"eb7ea558-f755-4e43-98a0-275f5ac5a278","resolution":{"observed_at":"2026-08-02T00:44:44.014790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:44.154403Z","title":"Sharegemini: Scaling up video caption data for multimodal large language models, June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:44.154403Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:28a1a57d0d998305caa246f67735ce209bddec2bb0c37a80f03dd6b8ea7a21ac","observation_id":"5334e404-e128-4616-891d-a8d35781854c","resolution":{"observed_at":"2026-08-02T00:44:44.154403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:44.322802Z","title":"Sharegpt-4o: Comprehensive multimodal annotations with gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:44.322802Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:8c429d2fc47b936965f6611ffcfe45bccd5bc8b516612425e72de0d4470a6b61","observation_id":"434eb6fd-db63-4997-8139-4e4e8e4601b0","resolution":{"observed_at":"2026-08-02T00:44:44.322802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:44.416164Z","title":"Bee: A high-quality corpus and full-stack suite to unlock advanced fully open mllms, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:44.416164Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:16f4a8403c9a86bdf430b9942f46557b2ab7884ace8e1ec40115ace2251c18c8","observation_id":"1c212413-8de1-446d-97f7-3302e944f610","resolution":{"observed_at":"2026-08-02T00:44:44.416164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:44.524832Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:44.524832Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:2f8700101160cb62e16624cdad50d1dbf3d5d63a5ce7bd13d993e47d2069aa53","observation_id":"73f7c1a8-e954-4cd3-b94e-18816196ddd5","resolution":{"observed_at":"2026-08-02T00:44:44.524832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01696","last_updated":"2019-05-07T21:34:05Z","snapshot_observed_at":"2026-07-06T06:59:26.080263Z","submitted_at":"2018-09-05T19:14:11Z","title":"TVQA: Localized, Compositional Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.01696","snapshot_observed_at":"2026-08-02T00:44:44.781343Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:44.781343Z"},"links":{"cited_paper":"/paper/1809.01696","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:ed4bf85dcf069692988da005c1908315c66b770397f1f38a266193da151fd46b","observation_id":"05740471-e970-4649-8eae-b3c488fdc495","resolution":{"observed_at":"2026-08-02T00:44:44.781343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:44.904024Z","title":"Finevideo","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:44.904024Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:1aa96ae0d7c7b3db113914e5e3e33f04c565514b92d2b96ecf528e7be8491882","observation_id":"dfe6d3b7-0d2d-478d-aad9-a23b8f8f4043","resolution":{"observed_at":"2026-08-02T00:44:44.904024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-07T17:42:30.374808Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-02T00:44:45.027159Z","title":"Cinepile: A long video question answering dataset and benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:45.027159Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:ad1fb9696de87510f7216e4a72e377b9025f02546593497ef4dad4bb8d50fa67","observation_id":"63fe83c7-4305-4236-8c2d-31689e10f41c","resolution":{"observed_at":"2026-08-02T00:44:45.027159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-09T01:53:18.568676Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-02T00:44:45.094167Z","title":"Videogpt+: Integrating image and video encoders for enhanced video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:45.094167Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:84ac018fe421998ed2185fda249143cfe75fbaed5609f2fd3046883d22f843c6","observation_id":"44f6e26a-3390-417a-a7dc-68dcecdda5ec","resolution":{"observed_at":"2026-08-02T00:44:45.094167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04497","last_updated":"2017-12-03T04:46:42Z","snapshot_observed_at":"2026-08-10T02:09:16.680532Z","submitted_at":"2017-04-14T17:57:01Z","title":"TGIF-QA: Toward Spatio-Temporal Reasoning in Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04497","snapshot_observed_at":"2026-08-02T00:44:45.137483Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:45.137483Z"},"links":{"cited_paper":"/paper/1704.04497","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:5cd13cf735028b8a6485e9234a87b25ecd7adcd4325db1b0ad00912f95f58e4c","observation_id":"d7aad7ba-4663-404f-86ec-3a64470c839f","resolution":{"observed_at":"2026-08-02T00:44:45.137483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:45.214475Z","title":"Tenenbaum","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:45.214475Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:a19254224d56b0157379d650d7e16a5314e91e1a5e1311c4303a52fa5d5bbdf0","observation_id":"933de6f8-6ff6-4e45-937e-4ccaa01c61c8","resolution":{"observed_at":"2026-08-02T00:44:45.214475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:45.353879Z","title":"Exo2ego: Exocentric knowledge guided mllm for egocentric video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:45.353879Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:35ef7dcc43080075e49ef90f0290cbc41ea86b7daca60c9ad7785e0ec350470e","observation_id":"ddffa66c-6b18-4507-8f6a-462f594e4986","resolution":{"observed_at":"2026-08-02T00:44:45.353879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:45.449671Z","title":"Motionbench: Benchmarking and improving fine-grained video motion understanding for vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:45.449671Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:57c8d20fbdb11e71094e69982447a281c256b020ae725899346fbb03ae176e20","observation_id":"29679ae7-b005-4d36-ab11-651511c0719a","resolution":{"observed_at":"2026-08-02T00:44:45.449671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:45.524820Z","title":"Lasot: A high-quality benchmark for large-scale single object tracking","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:45.524820Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:92e8c8f19eede57975cc8142d703d3eda433b4d545c96df3a0fb936f91252b97","observation_id":"12757dcf-7036-41ce-b4ac-9ceee6d0bd8b","resolution":{"observed_at":"2026-08-02T00:44:45.524820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:45.610802Z","title":"Got-10k: A large high-diversity benchmark for generic object tracking in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:45.610802Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:292c9cf6f9c2e8bcd8b06c2174c4bf766d97ebef4de92091e9855810057f2f29","observation_id":"92921bda-1059-4880-aed9-db3eb7094c78","resolution":{"observed_at":"2026-08-02T00:44:45.610802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:45.825885Z","title":"Ross, Carl Vondrick, Caroline Pantofaru, Yeqing Li, Sudheendra Vijaya- narasimhan, George Toderici, Susanna Ricco, Rahul Sukthankar, Cordelia Schmid, and Jitendra Malik","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:45.825885Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:70e351c189985512a7cf692e65fd0d776952011886c3178c2db7d2e85f6c99cb","observation_id":"68d5b2d2-ca47-477e-9453-4f25bba290d2","resolution":{"observed_at":"2026-08-02T00:44:45.825885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:45.896415Z","title":"Egovqa-an egocentric video question answering benchmark dataset","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:45.896415Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:b132e9a21f722b75e01d95585246a9550d2a22e2aa289bad2a9fbb9af3dc3329","observation_id":"797fe49c-7856-46dc-a804-f06fab2fc2cd","resolution":{"observed_at":"2026-08-02T00:44:45.896415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:45.961453Z","title":"Learning transferable temporal primitives for video reasoning via synthetic videos, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:45.961453Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:f89f58c85af0ab129675dadf1ed9df77fe22623d0ea2cfa63d22c918782a8faa","observation_id":"28367e16-b65d-4c7e-84da-1042e0956299","resolution":{"observed_at":"2026-08-02T00:44:45.961453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:46.065996Z","title":"Tomato: Assessing visual temporal reasoning capabilities in multimodal foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:46.065996Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:219d930b7ee6bfabfb997e13a6b89fbb6134f34b78ec74360831c6b5d7a07d0d","observation_id":"e21f2666-0810-4545-b42d-eb15d92e4cfc","resolution":{"observed_at":"2026-08-02T00:44:46.065996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-10T12:02:14.593194Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-02T00:44:46.152973Z","title":"Tvbench: Re- designing video-language evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:46.152973Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:4f450ab3dd34c029018385b32d7750626290feee2862ebe5eb6751affa43545a","observation_id":"8e3ba013-2d83-496e-9ee5-82869176d604","resolution":{"observed_at":"2026-08-02T00:44:46.152973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:46.342096Z","title":"Tempcompass: Do video llms really understand videos? In Findings of the Association for Computational Linguistics: ACL 2024 , pages 8731–8772","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:46.342096Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:a0648d0b4ac313e3d906ddaf7e64a2bd5f4e08b56be573a3021ed714e1f0c003","observation_id":"cc81c15b-8707-4181-a9b9-f212d9ff8779","resolution":{"observed_at":"2026-08-02T00:44:46.342096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:46.436665Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:46.436665Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:2a39d6999ff3cae07b722aa927359135574d94b361312989cc33712141e069eb","observation_id":"57d2e2c4-13c4-4e1d-a7e6-9879a171b493","resolution":{"observed_at":"2026-08-02T00:44:46.436665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-02T00:44:46.573335Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:46.573335Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:b4fb218deff0c1fd24a345eecf7744bc1f1f7a9dbbd5b41d5666e1117743b32d","observation_id":"b1af6863-d03b-4ec8-8da1-c04869640ed1","resolution":{"observed_at":"2026-08-02T00:44:46.573335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14640","last_updated":"2025-05-20T17:26:32Z","snapshot_observed_at":"2026-08-10T08:26:12.719387Z","submitted_at":"2025-05-20T17:26:32Z","title":"VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14640","snapshot_observed_at":"2026-08-02T00:44:46.835407Z","title":"Videoeval-pro: Robust and realistic long video understanding evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:46.835407Z"},"links":{"cited_paper":"/paper/2505.14640","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:feeac1fdbbc462c2fe607d6bb8d6eccd58006dbf50ee7654c21cd43c6467245f","observation_id":"84ee4e48-c29d-4129-aa2e-0182b72b4e4e","resolution":{"observed_at":"2026-08-02T00:44:46.835407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-02T00:44:47.002048Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline professional videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:47.002048Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:11f41bf028b10e394a51f41e8eff1b25d33d1db30a7f81e4fb6668b5796186eb","observation_id":"1a0e508e-08bc-41c5-a574-c1a893454cb8","resolution":{"observed_at":"2026-08-02T00:44:47.002048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:47.229883Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:47.229883Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:7dcc7ae75b2c7267b9d866faed4c9fbbf610b1298557ffa13f19df0b32338c74","observation_id":"6c9669d4-2c06-4e4e-bba6-df62de1d7772","resolution":{"observed_at":"2026-08-02T00:44:47.229883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:47.313301Z","title":"Minerva: Evaluating complex video reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:47.313301Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:ed15a25b7c128a5fe9c06d3578b1f2b5954acacbf8d45083ff69d6438e17e217","observation_id":"6cf8ffcd-ab76-4593-9b85-c9087da6b0f0","resolution":{"observed_at":"2026-08-02T00:44:47.313301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05015","last_updated":"2026-04-06T17:59:56Z","snapshot_observed_at":"2026-08-11T05:50:34.916262Z","submitted_at":"2026-04-06T17:59:56Z","title":"Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05015","snapshot_observed_at":"2026-08-02T00:44:47.434527Z","title":"Video-mme-v2: Towards the next stage in benchmarks for comprehensive video understanding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:47.434527Z"},"links":{"cited_paper":"/paper/2604.05015","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:6b4ddb7e8ede0f10bdaca2cc962e6b983224bf71cd7d1a40b37466a1755769d0","observation_id":"f09832a2-f0ac-4d92-aefe-e83c8dbc9759","resolution":{"observed_at":"2026-08-02T00:44:47.434527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:47.600495Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:47.600495Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:1c7891f51bd27e973fe5f6715fd15003281a3672577b9cb7340de312a1e13743","observation_id":"cb923698-d405-4226-9789-6d1f8bdb5cc4","resolution":{"observed_at":"2026-08-02T00:44:47.600495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:47.761237Z","title":"Dense-captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:47.761237Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:f0b8a86e4b7e51506fc005f3145bb3e8eb78f0e50774da96ad6f96f5b7484b1f","observation_id":"2685caf0-64d8-4b74-8a34-57bfd9f32434","resolution":{"observed_at":"2026-08-02T00:44:47.761237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:47.805666Z","title":"Detecting moments and highlights in videos via natural language queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:47.805666Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:eeb5a7e8de63fd8d10a95bd6c549920ac45eb2fa4b59ccec918b2c8ef837a4b7","observation_id":"3ec15f71-9897-4104-ab87-3af549c81da9","resolution":{"observed_at":"2026-08-02T00:44:47.805666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15681","last_updated":"2025-07-16T22:41:17Z","snapshot_observed_at":"2026-08-10T08:10:44.637243Z","submitted_at":"2025-04-22T08:04:45Z","title":"Vidi: Large Multimodal Models for Video Understanding and Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15681","snapshot_observed_at":"2026-08-02T00:44:47.844379Z","title":"Vidi: Large multimodal models for video understanding and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:47.844379Z"},"links":{"cited_paper":"/paper/2504.15681","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:3ef9808ff090d916584039588b363847f1b8ba89e2141b190335e396f42675f6","observation_id":"8536bac6-8a77-49a4-be09-1afb22f38f08","resolution":{"observed_at":"2026-08-02T00:44:47.844379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:47.884749Z","title":"Vidi2: Large multimodal models for video understanding and creation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:47.884749Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:834d348b9a13dd983360d7da6bde18c381997cac09ec0d67c00c6339c9179288","observation_id":"40348e98-5b43-4527-8e75-a38ed0aeb684","resolution":{"observed_at":"2026-08-02T00:44:47.884749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:47.923648Z","title":"Momentseeker: A task-oriented benchmark for long-video moment retrieval","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:47.923648Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:f32748e6a314ce15d7c80f0f15de2ce1ef452ebe464669d34ac837cd8d2df4c8","observation_id":"54903a52-59db-465b-91bf-80471d354aa0","resolution":{"observed_at":"2026-08-02T00:44:47.923648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:47.963677Z","title":"GPT-5 system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:47.963677Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:f7da82c42dc38090f1633f03e40f2eafa57ce186fd1ebf6061d26274612fa6dc","observation_id":"adf89ab0-e959-4a7b-84ad-7c967815939f","resolution":{"observed_at":"2026-08-02T00:44:47.963677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T00:44:48.014595Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:48.014595Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:4ecea331fef8fb8d1a58770335ef725535a3e94c1a5620e3691713b45ff18aa5","observation_id":"7e079e2a-41aa-4261-81bf-284bf742459e","resolution":{"observed_at":"2026-08-02T00:44:48.014595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:48.141435Z","title":"Introducing claude sonnet 4.5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:48.141435Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:4f1df53d80fc958d9583025f974a727d56d2e2e59998d96f5f59e79e2e61a72d","observation_id":"527104fb-143b-4554-aacb-595ec68ac764","resolution":{"observed_at":"2026-08-02T00:44:48.141435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-08-09T11:10:24.301223Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-08-02T00:44:48.181447Z","title":"Minicpm-v 4.5: Cooking eﬀicient mllms via architecture, data, and training recipe","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:48.181447Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:ae3b7bea5e1957d418283c9b49c24e7c55f87ef50eb6237634ab6febff735bc9","observation_id":"29f11d55-cb24-4841-99a3-6ac23f236f6a","resolution":{"observed_at":"2026-08-02T00:44:48.181447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:48.248621Z","title":"Eagle 2.5: Boosting long-context post-training for frontier vision-language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:48.248621Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:f859faae693bf336501dac3830a921d83b7b7efa6400528b28837422ac289071","observation_id":"4bb62b33-3fc7-4574-9664-dd78ac3c8c3b","resolution":{"observed_at":"2026-08-02T00:44:48.248621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-02T00:44:48.337537Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:48.337537Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:2bb7b4a11795c67701cf77ce1563aa497fb3a4d92a3c2502e3255f7f26ff7cc0","observation_id":"4f6503ae-9746-4fe7-918f-cbccd66be913","resolution":{"observed_at":"2026-08-02T00:44:48.337537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-02T00:44:48.427210Z","title":"Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and eﬀiciency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:48.427210Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:43188a4ea9eda3153f3e90607dda142e93534ce583f58f163b9a7d439982e16e","observation_id":"34055a81-c4a9-4c9c-957e-3431b35f15f0","resolution":{"observed_at":"2026-08-02T00:44:48.427210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:48.525948Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:48.525948Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:390e7c82fcbe6eef905f616b3110801f5af59136973134a02ba8ba60b729768a","observation_id":"bb5c00dc-8b5c-4208-a414-9e766e2d3148","resolution":{"observed_at":"2026-08-02T00:44:48.525948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:48.594780Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video understanding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:48.594780Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:4c4c5ba4d1f060fb886735643b8ab644f606f041c7674acb55e7b3f21d2ca196","observation_id":"45268e19-3c2e-44e5-8398-aa21ee8d91ec","resolution":{"observed_at":"2026-08-02T00:44:48.594780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:48.759089Z","title":"River: A real-time interaction benchmark for video llms","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:48.759089Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:9113dbb89e5d8007bbf0b0658e8968d488419d56e717e6bff7e12eecd7bc08e1","observation_id":"d7a17479-bc58-446d-8e99-0bea900400df","resolution":{"observed_at":"2026-08-02T00:44:48.759089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19054","last_updated":"2026-06-28T06:24:45Z","snapshot_observed_at":"2026-07-13T22:13:00.259166Z","submitted_at":"2026-03-19T15:47:50Z","title":"Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.19054","snapshot_observed_at":"2026-08-02T00:44:48.868441Z","title":"Em-garde: A propose-match framework for proactive streaming video understanding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:48.868441Z"},"links":{"cited_paper":"/paper/2603.19054","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:85350da50d9fd8ae9006a2741a14921b815440b489cfdc9a177c7527cae124cd","observation_id":"e8ee7c1c-267d-4f8c-b05d-d9d00aca60ac","resolution":{"observed_at":"2026-08-02T00:44:48.868441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09313","last_updated":"2025-07-15T11:48:07Z","snapshot_observed_at":"2026-08-09T21:58:49.061689Z","submitted_at":"2025-07-12T15:11:50Z","title":"ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09313","snapshot_observed_at":"2026-08-02T00:44:48.909159Z","title":"Proactivevideoqa: A comprehensive benchmark evaluating proactive interactions in video large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:48.909159Z"},"links":{"cited_paper":"/paper/2507.09313","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:7b451536efb41719f0f5069c3fc2fe141a65e7f1bc8b6ade0334cdfb76b1bb28","observation_id":"7523c331-160b-4a39-b74a-911205ccb356","resolution":{"observed_at":"2026-08-02T00:44:48.909159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:49.000448Z","title":"Livecc: Learning video llm with streaming speech transcription at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:49.000448Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:a423925cc1b20798e087d7fff9d0954f06de7fe3ad0fb7428c532f1c43dd9453","observation_id":"2a95b4f6-12f8-44f1-b33f-20cffae494f8","resolution":{"observed_at":"2026-08-02T00:44:49.000448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:49.159431Z","title":"Timechat-online: 80% visual tokens are naturally redundant in streaming videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:49.159431Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:8bc9adb8d8e1ec8aa4c4594d3ff0ae076af378404141006b48cd074262c02079","observation_id":"eef673cb-ab0d-41eb-96c0-09b8a853e2c3","resolution":{"observed_at":"2026-08-02T00:44:49.159431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09608","last_updated":"2025-10-10T17:59:58Z","snapshot_observed_at":"2026-08-08T02:53:06.532732Z","submitted_at":"2025-10-10T17:59:58Z","title":"StreamingVLM: Real-Time Understanding for Infinite Video Streams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.09608","snapshot_observed_at":"2026-08-02T00:44:49.226362Z","title":"Streamingvlm: Real-time understanding for infinite video streams","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:49.226362Z"},"links":{"cited_paper":"/paper/2510.09608","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:e8a8e3649c6938dc2d5a0336de31fc2504d010e014da5813bcb88c4ec0213d35","observation_id":"f7dbb6e1-fc38-43aa-a75a-89864475aee9","resolution":{"observed_at":"2026-08-02T00:44:49.226362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:49.297464Z","title":"Mm- duet2: Enhancing proactive interaction of video mllms with multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:49.297464Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:d8a94686cd8bf1d7c8717c9a124e646a19ba8cee41b696943fc0fd9175c37744","observation_id":"1a57edb3-07ad-4d15-83ec-8fb67b370d25","resolution":{"observed_at":"2026-08-02T00:44:49.297464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-02T00:44:49.338761Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:49.338761Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:c11c52eac4f6735e2d4c2e2f347d630602b17bd8a9afd4951570e9a36c3e10fb","observation_id":"43fc2d0a-4e5a-49ff-8900-0cd58958772e","resolution":{"observed_at":"2026-08-02T00:44:49.338761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-02T00:44:49.393750Z","title":"Videochat: Chat-centric video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:49.393750Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:401f6d2b6c7225a7f8844f1fa0ed524dfa55bc664de83de6996ae3d3be9a9cd5","observation_id":"34cdd0cd-7ef9-42b9-8cc2-6c5f5665e243","resolution":{"observed_at":"2026-08-02T00:44:49.393750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:44:49.433839Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:49.433839Z"},"links":{"citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:684df46013e83153c9eeba4e4820ea2250fc9da995df432d1e3ee67e6f89a4cf","observation_id":"52d95c55-6cca-42a4-8338-c243094e56f0","resolution":{"observed_at":"2026-08-02T00:44:49.433839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-02T00:44:49.479276Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:49.479276Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:eff6fd6ebae881f1288fe9341989c8b4a84602e9c50393d5ea10817b460e78fa","observation_id":"5a1eb399-e080-47c6-b0d6-af99858ce804","resolution":{"observed_at":"2026-08-02T00:44:49.479276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-02T00:44:49.528523Z","title":"Llava-onevision: Easy visual task transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:49.528523Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:ff497de41baac3957ca429a86b4e2d8e82768727061944da385b69585bb3837a","observation_id":"b2fcb43b-74dd-4bf0-bd01-d9d6382cb93f","resolution":{"observed_at":"2026-08-02T00:44:49.528523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.25979","snapshot_observed_at":"2026-08-02T00:44:49.651285Z","title":"Llava-onevision-2: Towards next- generation perceptual intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:49.651285Z"},"links":{"cited_paper":"/paper/2605.25979","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:63d122260f400df8ab21d90b6c95e130b903ae4407384bf950c49e7eccf5daf6","observation_id":"916cc133-aeb9-4a69-85be-5014ca2f787c","resolution":{"observed_at":"2026-08-02T00:44:49.651285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04603","last_updated":"2024-10-06T04:02:38Z","snapshot_observed_at":"2026-07-06T18:42:01.518014Z","submitted_at":"2024-07-05T15:52:23Z","title":"AWT: Transferring Vision-Language Models via Augmentation, Weighting, and Transportation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04603","snapshot_observed_at":"2026-08-02T00:44:49.747631Z","title":"Awt: Transferring vision-language models via augmentation, weighting, and transportation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:49.747631Z"},"links":{"cited_paper":"/paper/2407.04603","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:6986ecf37b2e9caa00ae5b3c3add2f5210a5c75e4f54a2731bdb67bad47cd17a","observation_id":"5939ccc1-f8be-42e1-91cf-a1dc4dec07c9","resolution":{"observed_at":"2026-08-02T00:44:49.747631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T10:08:14.840784Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":122},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 122 outbound references and 0 inbound Pith citation observations for arXiv:2607.14935."}