{"as_of":"2026-08-08T02:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc92646dae0cd3d027ebb099f7e0fa984992eadb03b9ec42e2ccbc499bcd21f7","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:51:07.923531Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:40:00.723218Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06928","snapshot_observed_at":"2026-08-02T05:40:00.723218Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13305","last_updated":"2026-07-14T22:15:50Z","snapshot_observed_at":"2026-08-04T07:12:56.462277Z","submitted_at":"2026-07-14T22:15:50Z","title":"Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:40:00.723218Z"},"links":{"cited_paper":"/paper/2506.06928","citing_paper":"/paper/2607.13305"},"observation_digest":"sha256:fb3d6d95b4624b38865c24cedf259b0f626b47f6239be6e54bed7ce251f0baf7","observation_id":"8c7647d5-6f3e-4110-8c64-34e90ee76aa9","resolution":{"observed_at":"2026-08-02T05:40:00.723218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06928/citation-record","integrity":"/paper/2506.06928/integrity","json":"/paper/2506.06928/citation-record.json","paper":"/paper/2506.06928"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:51:07.773495Z","title":"Qwen2.5-VL Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.773495Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:e651e93a7aee712782b6e0bad270fa5114531a74bca752813f9882df05a9ab8d","observation_id":"65c748a2-cd0b-461a-97a9-c9cd92477f4f","resolution":{"observed_at":"2026-08-07T05:51:07.773495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.454497Z","title":"ShareGPT4Video: Improving Video Under- standing and Generation with Better Captions","venue":null,"work_id":"c8fb9dc7-875f-4639-af30-7faf82da2d44","year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.779399Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:a0376a3cc30658181f5164be88e6d0998be470879e896ff95544cc3cfd1b6dca","observation_id":"285cf941-cb86-40de-8a0d-f2cc99af891e","resolution":{"observed_at":"2026-08-07T05:51:08.459611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T05:51:07.784472Z","title":"VideoLLaMA 2: Advancing Spatial- Temporal Modeling and Audio Understanding in Video- LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.784472Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:008a458e9b1bb043fa0d030193eef3ef31969d20bdc0566dccdf8e7edcbd32df","observation_id":"ea581482-7c3a-42a9-a25d-ee24df90f017","resolution":{"observed_at":"2026-08-07T05:51:07.784472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-05T14:33:12.627325Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-07T05:51:07.790019Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.790019Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:4ba97b0c0395bc7982dd64aa197169915a56b5436fc2df18762324f6eea0ad64","observation_id":"03cff194-f5a0-4074-90c0-a2701db95f6b","resolution":{"observed_at":"2026-08-07T05:51:07.790019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T05:51:07.795669Z","title":"Video-MME: The First- Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.795669Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:75ab6e57d777d49dbdcd6f95fc2c47124fcf81b877255feaf321e1179d7a94bb","observation_id":"4f6aa8c0-6d3b-4c63-9c20-f096c821bc1d","resolution":{"observed_at":"2026-08-07T05:51:07.795669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:51:07.800928Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.800928Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:fa9708a6be49a9dd381619239bc18c07a9f886f49451c50edce01b22a331f1ad","observation_id":"1c2a4e8b-65ba-4337-a695-abd2ff200285","resolution":{"observed_at":"2026-08-07T05:51:07.800928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.438605Z","title":"MA-LMM: Memory-Augmented Large Multimodal Model for Long-Term Video Understanding","venue":null,"work_id":"2e84e976-f48c-455b-8479-075eb246e51b","year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.806446Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:49f9f750b4d556bcbe876f426b0f526e1a13b354e1bda101e416a295e04cce1e","observation_id":"bf156721-0a82-4991-b65e-8aa7f00a3508","resolution":{"observed_at":"2026-08-07T05:51:08.443799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.421489Z","title":"LoRA: Low- Rank Adaptation of Large Language Models","venue":null,"work_id":"a7421821-9684-4df4-b10a-18ad7ac4d896","year":2022},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.811592Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:efc7f705376bfbcc542d18595e0e26c84ee98026db8b92d7789fe679115c2efc","observation_id":"063e0f5c-e995-4454-a493-83357a8972d4","resolution":{"observed_at":"2026-08-07T05:51:08.427508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.401954Z","title":"TGIF-QA: Toward Spatio-Temporal Reason- ing in Visual Question Answering","venue":null,"work_id":"79acf9b4-d30b-49c1-a0ca-ffe55ed20eac","year":2017},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.817057Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:0679e0f39108109e0e8bafdf561b41d1f34e0f2603e433c7a4548304ad3785ef","observation_id":"ed31497f-5f07-422d-869b-cc8a4a3fd827","resolution":{"observed_at":"2026-08-07T05:51:08.408349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.383472Z","title":"CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning","venue":null,"work_id":"4fbf0fe8-3a87-428d-8340-ebd097dbee63","year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.822018Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:b66de9b61694d64b3c86f5ccd986139a3eba50b0f515f7921b9928a9e2d73c29","observation_id":"09ad63b2-12d0-452e-b6c1-6bcae633622a","resolution":{"observed_at":"2026-08-07T05:51:08.389004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.367735Z","title":"JUWELS Cluster and Booster: Exascale Pathfinder with Modular Supercomputing Architecture at Juelich Supercomputing Centre","venue":null,"work_id":"2b0c624d-0b56-4c16-ae6c-710ba64076f4","year":2021},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.827043Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:cd3f609f6a6389c98e81ec4a67952d2a0dc82798e15324b9d66e840e5dc4f49b","observation_id":"053fb2fb-be20-41d5-ad0e-0dc963146e8b","resolution":{"observed_at":"2026-08-07T05:51:08.373009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:51:07.831670Z","title":"LLaV A-OneVision: Easy Visual Task Trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.831670Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:8509debdd1360dc909b7cca02171e571fbae1d5cc91fe7efb637517328b47992","observation_id":"a8b5ff99-15ec-41f0-8177-5e10f582f342","resolution":{"observed_at":"2026-08-07T05:51:07.831670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.352792Z","title":"MVBench: A Comprehensive Multi-modal Video Under- standing Benchmark","venue":null,"work_id":"277ed4e3-f05d-454f-b2dc-f40e1d204566","year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.836882Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:1305a3793a61435d556f180d74b5a6a7fd46c7aefbba1aa1204d9e11053b94a7","observation_id":"39381d6c-50ee-468e-a4a9-55417ca9e93c","resolution":{"observed_at":"2026-08-07T05:51:08.357663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-08-07T05:51:07.841588Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.841588Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:ce7dff9317053f9932ecd70665014fb527839e02bc040fcbfdbc7dad248c99c5","observation_id":"ad71e2fe-5895-4c17-814c-8f8992cfa555","resolution":{"observed_at":"2026-08-07T05:51:07.841588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.338169Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","venue":null,"work_id":"59e806c0-6f5f-4cf4-acca-c73ac3925997","year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.846524Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:1d3a5181e98ebbef931a85031e26094ab1a7e8ff7368cfd4a1a6ab090024bbe7","observation_id":"6e1e2824-7908-4c1d-9206-0cf2f47da698","resolution":{"observed_at":"2026-08-07T05:51:08.342865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.323042Z","title":"Video-LLaV A: Learning United Visual Representation by Alignment Before Projection","venue":null,"work_id":"143e91b7-b2c7-4fe8-991b-a770a76f5b4e","year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.851065Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:a0252536ee206ff260203e39c24ab4b5dcf211c2696cf90a7923ea4d3ebb3e99","observation_id":"9f8edbfe-10aa-4d2c-ae75-c677098d699e","resolution":{"observed_at":"2026-08-07T05:51:08.327932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.306752Z","title":"Microsoft COCO: Common Objects in Context","venue":null,"work_id":"1e2a3380-b980-4292-af50-518acf7b3343","year":2014},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.855756Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:a35339e8e731896e35db1c8016c964bf9c7c401d83d598c87f414bcb90a1c44d","observation_id":"5b7ce0b0-5171-461d-a9b3-8f1314059ba4","resolution":{"observed_at":"2026-08-07T05:51:08.312225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-07T05:51:07.860377Z","title":"Oryx MLLM: On-Demand Spatial- Temporal Understanding at Arbitrary Resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.860377Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:d5e89fb899d5ef3a5d24ba07bcc017e929c0bea8f8b84669c10fa0bc5fca1dca","observation_id":"9ebd11f4-cb7d-4fc7-9870-6582a89258f8","resolution":{"observed_at":"2026-08-07T05:51:07.860377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.291049Z","title":"Video-ChatGPT: Towards Detailed Video Under- standing via Large Vision and Language Models","venue":null,"work_id":"b5719ba5-e94f-41ca-914b-ab8a171cb09a","year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.865389Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:9ad827ce346dab6e72d760e3f777c85095b7a1c7f3749bedccc6241635be8908","observation_id":"bf28ca4d-4cfe-4ed5-8dd5-db851bd7a74d","resolution":{"observed_at":"2026-08-07T05:51:08.296144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.273628Z","title":null,"venue":null,"work_id":"cfedf968-6053-4027-bfb7-971cefe7c1a8","year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.869984Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:c47a91deaa249ec4bc7f875355329087f5f754403f083045ee36e4e5246db9f8","observation_id":"d9d66231-4270-478c-bf57-9fa8221d2497","resolution":{"observed_at":"2026-08-07T05:51:08.279071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.256807Z","title":"Learning Transferable Visual Models From Natural Language Super- vision","venue":null,"work_id":"4cdd1df3-4105-4846-985f-2780d0cd86fd","year":2021},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.874688Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:ee45d719b51a4ed219d9c9a9abd031ce3885aa76c5fd974aacd55c7ac27cb105","observation_id":"f86bf564-bf9b-4076-b424-f45354ce05a1","resolution":{"observed_at":"2026-08-07T05:51:08.262254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-07T05:51:07.879150Z","title":"Kim, Bilge Soran, Raghuraman Krishnamoor- thi, Mohamed Elhoseiny, and Vikas Chandra","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.879150Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:22fb822df1fc7bb9309054593e585a94434b8893b8d99f89378e5826febc27ca","observation_id":"6dce3466-df81-459c-a18d-87100f0d2f40","resolution":{"observed_at":"2026-08-07T05:51:07.879150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-07T00:13:25.095002Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T05:51:07.884760Z","title":"Tarsier: Recipes for Training and Evalu- ating Large Video Description Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.884760Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:6d9c3d722312e00297d2d03b1e8285d13baee77d945d99b6fe9cf85a66e36fe5","observation_id":"0cb707a5-6917-4e9f-b00d-1c255f096643","resolution":{"observed_at":"2026-08-07T05:51:07.884760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.239463Z","title":"LongVideoBench: A Benchmark for Long-context Inter- leaved Video-Language Understanding","venue":null,"work_id":"3bc68393-218b-40bb-8a1b-5026db448c45","year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.889776Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:b2e4a0ebeada655573d738073a55b43f3156c7a1e78efc7edf8b2fe21353c0d5","observation_id":"c3ee944a-08d6-479e-a3b3-22b187f7925e","resolution":{"observed_at":"2026-08-07T05:51:08.244690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.222986Z","title":"MSR-VTT: A Large Video Description Dataset for Bridging Video and Language","venue":null,"work_id":"835c11ea-da7c-44f0-ad6a-bb49114f7ace","year":2016},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.895050Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:52b9d768facd08cb522bac8853b70b6f10f63d6f15ea94603c2f0347cc6a133c","observation_id":"4e0dc231-9de6-4f15-8f1e-0112554d8688","resolution":{"observed_at":"2026-08-07T05:51:08.228268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T05:51:07.899664Z","title":"PLLaV A : Parameter-free LLaV A Extension from Images to Videos for Video Dense Captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.899664Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:3fa25b908e66c04a1e6fad268d561d6daf3389d9e182cb54bfc5d278c3db46eb","observation_id":"897dc92b-73ff-4532-9744-3ca2e42c1f23","resolution":{"observed_at":"2026-08-07T05:51:07.899664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.206365Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","venue":null,"work_id":"573a6da5-ff52-48ef-aaee-8591f2628a74","year":2019},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.904430Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:3794cdfc38966bf30b1d38c4dcaba1c5c6abfe533044409d9cf0f1d137b57781","observation_id":"87ec161b-a15b-4e8c-afd8-4be53ef31414","resolution":{"observed_at":"2026-08-07T05:51:08.211642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.189942Z","title":"ActivityNet-QA: A Dataset for Understanding Complex Web Videos via Question Answer- ing","venue":null,"work_id":"629ee871-1d76-4326-9926-ba4f40bbb7f7","year":2019},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.909084Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:6d37c647bab1869918d7dfa62ee5a592d2dd207a1550d5bebfc90073e1538590","observation_id":"ff108d37-dfb5-4f80-8fa6-b5a81e09e326","resolution":{"observed_at":"2026-08-07T05:51:08.195305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-07-06T20:20:47.146343Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-07T05:51:07.913992Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.913992Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:6e716424ed1e1d20cd411438bc870eae0167502c430d5108dabe65c64720b1a0","observation_id":"c96d5b97-b387-450b-a5f1-13dc333d2a9f","resolution":{"observed_at":"2026-08-07T05:51:07.913992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:51:08.170484Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":null,"work_id":"4580149a-918a-48b7-b6e3-9e8144196a38","year":2023},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.918987Z"},"links":{"citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:cfd95248435a861f35adc13f1956bc5e9bdedf7317683444f9f3c230be57df3a","observation_id":"5faf4ef4-d8e6-4340-b5db-458784a5186f","resolution":{"observed_at":"2026-08-07T05:51:08.177820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T05:51:07.923531Z","title":"Video Instruction Tuning With Synthetic Data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:07.923531Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.06928"},"observation_digest":"sha256:38b00f30d53b8801db4d48140fe01f65d78b991c8f3123a31fe607b824fdb9ea","observation_id":"b6f15c9d-18d7-4e73-9bcc-4a2501bf2bc6","resolution":{"observed_at":"2026-08-07T05:51:07.923531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06928","last_updated":"2025-06-07T21:32:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:43:53.719506Z","submitted_at":"2025-06-07T21:32:19Z","title":"How Important are Videos for Training Video LLMs?"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2506.06928."}