{"as_of":"2026-08-13T17:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac32d4028c66c86eddc9d114ca3b8488fbb66363f28dafcf8e1c81afb9996fa3","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:43:03.400998Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12355/citation-record","integrity":"/paper/2411.12355/integrity","json":"/paper/2411.12355/citation-record.json","paper":"/paper/2411.12355"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.834107Z","title":null,"venue":null,"work_id":"55406728-5344-4476-85bc-09addb898427","year":2017},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:02.999634Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:19e77d76bd00f4ce6f050d4ad68d13259c269fe9bfba744cdcaade4687f38cb7","observation_id":"2192909b-a3ec-40ac-aa7f-5a5b0ac5a6cd","resolution":{"observed_at":"2026-08-12T17:43:04.840167Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.815371Z","title":"Textvqa: Towards understanding of visible and invisible text in images","venue":null,"work_id":"e522ac3f-a3b5-4b92-865b-5b612052ffd0","year":2019},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.005333Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:38bc6c144bf99d0d0bd6811e7bc489fc5a582238ab621769237a5b1d62e5de25","observation_id":"ccf63729-4ef7-4c31-9099-15657401fcf3","resolution":{"observed_at":"2026-08-12T17:43:04.821791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-13T00:37:45.501808Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-12T17:43:03.010674Z","title":"Minigpt4-video: Advancing multimodal llms for video un- derstanding with interleaved visual-textual tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.010674Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:f0f9dc703c8f2241b22c3c0a85c2708ef34408d86035c736f05247a3b1246f70","observation_id":"a7df40f1-6a21-465e-8c84-95e39da5afaa","resolution":{"observed_at":"2026-08-12T17:43:03.010674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.795565Z","title":"Frozen in time: A joint video and image encoder for end-to- end retrieval","venue":null,"work_id":"c32cc981-1fb9-4e01-be79-0b98f9e2441b","year":2021},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.016186Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:cc077d8dade0a704acfb3cf97212cf5548843c17eeb506ee658f5ab67eb79b6f","observation_id":"ae255e3c-586c-4dc1-aa72-d127c3ac2d32","resolution":{"observed_at":"2026-08-12T17:43:04.802082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.775566Z","title":"Frozen in time: A joint video and image encoder for end-to- end retrieval","venue":null,"work_id":"615e2ebb-6c00-49ba-a760-4a4fd9775e11","year":2021},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.021259Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:a0e2fe6b043650e9935e46ecdf83da669318a7614d055dddf2b3eeea4109c8ed","observation_id":"036feb4b-a3b7-4b69-93c4-d10d7eba5f3c","resolution":{"observed_at":"2026-08-12T17:43:04.782344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08676","last_updated":"2020-06-09T15:09:00Z","snapshot_observed_at":"2026-08-11T01:42:10.269368Z","submitted_at":"2020-02-20T11:11:32Z","title":"Learning with Differentiable Perturbed Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08676","snapshot_observed_at":"2026-08-12T17:43:03.026435Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.026435Z"},"links":{"cited_paper":"/paper/2002.08676","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:40448882e330137520e8ed9e93c91a245874ff8bf705fe0bb270d3cc13c554d0","observation_id":"47c3774e-a343-4e4e-9a7a-3209d40cd88d","resolution":{"observed_at":"2026-08-12T17:43:03.026435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.755464Z","title":"Activitynet: A large-scale video bench- mark for human activity understanding","venue":null,"work_id":"3a077549-4f0f-447e-bf9e-36234ca92e0a","year":2015},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.032611Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:b6e9a9c280cfabe0909e17b2c3f0fe86e1fceda6d8d732be97d7108c2cb57d83","observation_id":"169e7c30-2c2d-47b9-b16c-25b842bf533a","resolution":{"observed_at":"2026-08-12T17:43:04.762216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.733629Z","title":"Chen and William B","venue":null,"work_id":"cc767ab4-0220-4374-aee5-019f13ef5c08","year":2011},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.037293Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:a52a9efe6487ccb651756fee639ffc78e019e9ee2d1d7292f1bc198f1a86838f","observation_id":"e2174da7-e12b-41df-aeb8-06e665057820","resolution":{"observed_at":"2026-08-12T17:43:04.741759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-12T17:43:03.047959Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video- llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.047959Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:b17f44ce260e55578db5db51801e5a59c7cf92901469dda418f9e4177282aeed","observation_id":"8c0bab9f-0d08-4aef-b355-b32aadb75f55","resolution":{"observed_at":"2026-08-12T17:43:03.047959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.053816Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.053816Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:842250277bda918df4048015c791bea4771ea285e335cb3de06ab075aac1db31","observation_id":"7c0a61f2-f1a3-46bd-9800-de413e0a100f","resolution":{"observed_at":"2026-08-12T17:43:03.053816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.058756Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.058756Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:771ddce11742d9acb8bd90122aa603881fd1e01183330156dcd9d7d67280af4b","observation_id":"53588708-e7e8-44db-86f2-a24f74c2d2c5","resolution":{"observed_at":"2026-08-12T17:43:03.058756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.671079Z","title":null,"venue":null,"work_id":"901e8cff-c914-4248-a743-1bd2a65cf066","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.063662Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:1dafe708804e956ab5d5b8f93731e92163d0ad90b7eec11fbd1faef0c81570e2","observation_id":"a94e7e06-e704-43d2-8ba4-b05789559123","resolution":{"observed_at":"2026-08-12T17:43:04.677150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.652766Z","title":"EgoQA: Egocentric question an- swering","venue":null,"work_id":"7ad3dbdd-72f0-4e23-bb59-84987b6c297e","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.068378Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:63ad1ef3c7438602c8c9ab23afbb6fadb2acac573927efbb72295fea9b98b6f8","observation_id":"8923c3c4-b5a4-4d60-b4ec-53ed7bae0b2e","resolution":{"observed_at":"2026-08-12T17:43:04.659167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.634322Z","title":"Study on density peaks clustering based on k-nearest neighbors and principal component analysis","venue":null,"work_id":"774075d5-aaa7-4fa8-afea-e8abd4bfa036","year":2016},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.073060Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:8eeebe8dd62a969f62662390b1da5e4c5006b60e868d1ef387a29e57a09a263e","observation_id":"5178ef37-024c-4463-8b7d-feb5f9a4adf1","resolution":{"observed_at":"2026-08-12T17:43:04.640474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.617102Z","title":"EV A: exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"e5d7892b-709d-42ec-8d36-9981267e4df6","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.077586Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:a400525a1e1c7f01248a41883c00d64b280743c00fcd647a936182429046a890","observation_id":"114aef3b-3e26-4775-92a2-779f5607bec3","resolution":{"observed_at":"2026-08-12T17:43:04.622796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.599340Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"78918f52-6cb1-4b18-ad3c-47dc7f1dcf55","year":2019},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.082185Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:4a641cc98345a6e8ddc1d3e335855a322c5cb68f21798d3e80f6285cf58b2d44","observation_id":"7a073534-89e0-4cd5-8319-8f235bfaaaef","resolution":{"observed_at":"2026-08-12T17:43:04.604589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.580546Z","title":"Semantic-aware modular capsule routing for visual question answering","venue":null,"work_id":"d9dd02a8-2a3a-45ba-9a23-9d7f45b8c629","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.086860Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:8861113c8ab763b95e82bcc24c08022765a95de79aa01c184d60ff4e869ce8e2","observation_id":"2b2efb6a-fb1c-44e9-ad25-53a1c8e3cfd0","resolution":{"observed_at":"2026-08-12T17:43:04.587504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.563248Z","title":"MA-LMM: memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"9c077dba-f275-4c2c-9b5e-e20d3174b434","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.091661Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:ef363de575360806f584e5b66c96bbaed62a44badef431528896adf90ae3ea60","observation_id":"967e23a5-a606-4c25-8945-23b63da30962","resolution":{"observed_at":"2026-08-12T17:43:04.568683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.546773Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"d71da16c-1d00-484d-8914-43aaddb3025d","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.096166Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:b53d85f50acdcf75654ca6246eab46bd8df85e8d1e242678f83fffd2dc927aac","observation_id":"5de07298-2e8b-4d31-94ad-f6ed51167c0a","resolution":{"observed_at":"2026-08-12T17:43:04.551934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.530062Z","title":"Activitynet: A large-scale video bench- mark for human activity understanding","venue":null,"work_id":"f5349d4b-d332-4de2-b456-6bf5e54060f4","year":2015},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.100797Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:2ce21c284c00b3d33d623369b0ae41bf455ebeb8920c1a79874c4f89edc7c873","observation_id":"6d4b9996-60c8-438c-b156-f73174c9c75e","resolution":{"observed_at":"2026-08-12T17:43:04.535708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.511824Z","title":null,"venue":null,"work_id":"44f9733b-563f-4997-b1c7-dd3b3ec59c1a","year":1986},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.105442Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:12563fc9152a7de5c2c3cd42e0b6ab84106def49f8efec74fa9604bbc6e13147","observation_id":"3d217d76-55f0-4919-988e-a7158c81f2f2","resolution":{"observed_at":"2026-08-12T17:43:04.518297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-13T05:13:34.055524Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-08-12T17:43:03.110131Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.110131Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:93bc78f235ed25aeb5ba92c5a87f151e3b715ddd2d87992619148868e8e4133c","observation_id":"02a8aba9-ed37-42e7-a542-a2bc61b21d20","resolution":{"observed_at":"2026-08-12T17:43:03.110131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.496000Z","title":"Ng, Hongqiang Rong, and Zichen Li","venue":null,"work_id":"1b35e6bc-a13d-4295-8a9c-ee7467bb41c1","year":2005},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.115496Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:15944db649c4a58f9486e6d7045c7bc7abe59b566298d2471db973a233c44426","observation_id":"a4a3e019-fd4d-42d8-8cec-21765358ad1e","resolution":{"observed_at":"2026-08-12T17:43:04.501170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.479225Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional questions","venue":null,"work_id":"23d5c386-0087-400e-af44-7e19ec3af91f","year":2019},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.120120Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:f353bba1c783635855d1771ca8e25e998e186a5bb41bcb90072699687c1704c4","observation_id":"1c862dea-09fb-40c2-8280-c60f3386f8ad","resolution":{"observed_at":"2026-08-12T17:43:04.484544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08046","last_updated":"2024-04-05T15:21:09Z","snapshot_observed_at":"2026-08-13T05:25:45.984864Z","submitted_at":"2023-11-14T10:11:36Z","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08046","snapshot_observed_at":"2026-08-12T17:43:03.124790Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.124790Z"},"links":{"cited_paper":"/paper/2311.08046","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:29bd629076fd4b9c2e4dc711e985caea3792c832f4dc5a9fdebd2bc79fdeee9d","observation_id":"a63abfb8-567c-49a0-aabe-73c348fdd3a4","resolution":{"observed_at":"2026-08-12T17:43:03.124790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T17:43:03.130132Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.130132Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:101f0ca19642808dfe29f32947c211c349a0f142d0297c31b34f58ddf147170a","observation_id":"2611f948-041c-4fcb-8df2-73f54e44b3ed","resolution":{"observed_at":"2026-08-12T17:43:03.130132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.457712Z","title":null,"venue":null,"work_id":"15ee55e5-867c-4bdf-8d7d-6c1c3a4aca96","year":2014},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.135145Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:42bc04af7a1b1cf4db4f0ff8eab24e6967be1c9929da2ceb90d88d238a1bc675","observation_id":"7b32a324-e24f-4f7b-ac0d-ebe87d4d61ba","resolution":{"observed_at":"2026-08-12T17:43:04.463976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.439634Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"e92cfe5d-ff90-472a-bb62-9ae97069f616","year":2015},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.140583Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:30b2f08da846ff73df71bdeca034e7ed237c476e29803cd5d83f810bc61726aa","observation_id":"d1aedadd-e8e9-4b7c-bc4b-b87f8f061e44","resolution":{"observed_at":"2026-08-12T17:43:04.444757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.422793Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"e0450b3f-4408-4979-8889-2163b6d19092","year":2017},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.145305Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:6f970865066f40886a48b7d1e16ca43002c2ccb18b7a05a7ccc007f98d88d245","observation_id":"1358aabb-24c5-4dfd-84b4-abf6534493aa","resolution":{"observed_at":"2026-08-12T17:43:04.428366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.405325Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"69e8c8ee-b0b8-47d1-980a-484e8ef94ae1","year":2017},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.150322Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:cbbb4bff18d2f0c99e59003903644dd6faf8128f203095a505d663f5663ec4d3","observation_id":"fe1aeb9e-49b2-4b88-8ada-5996889d545e","resolution":{"observed_at":"2026-08-12T17:43:04.411158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-12T17:43:03.155428Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.155428Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:00bd4c9f5f69fe90fd19a9f5f3eed17b577294123d7f904f204ed58762ca1dd2","observation_id":"8dd26375-64c0-4b7c-87be-1d82ecc6d9e3","resolution":{"observed_at":"2026-08-12T17:43:03.155428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-12T17:43:03.160467Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.160467Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:a99c957f393a939ce85e01be1641c7458770abd69246743411515c636ca76831","observation_id":"4b36e757-7f2d-47c3-b746-91d1986490f7","resolution":{"observed_at":"2026-08-12T17:43:03.160467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.387118Z","title":"Scienceqa: A new dataset for science question answering","venue":null,"work_id":"7bafe729-16d2-44a1-8529-e32417d6f5a5","year":2021},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.165529Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:79f557cd4b92de53bda7c82a15cf24f77932017c205150e9b6602ee17f32f233","observation_id":"d816dd29-779c-4244-9cf9-18ca9a8829ea","resolution":{"observed_at":"2026-08-12T17:43:04.392817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.367043Z","title":"Learning dynamic routing for semantic segmentation","venue":null,"work_id":"07485e90-d352-437c-9694-d1db392354b0","year":2020},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.170423Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:96f929fa1d8dcdfcfa7d2913a72c7a3c75c4bff2ea7e35a2c0470cda08f83415","observation_id":"afc0463e-dede-48a9-9cd3-afd740fe1de1","resolution":{"observed_at":"2026-08-12T17:43:04.373424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-13T05:15:07.522678Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-12T17:43:03.175123Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.175123Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:7877ced20e530779f8efcc79f4baee4879d4626ecac39812cb562f85f0df32f4","observation_id":"eb7e9455-6eaf-461f-8f19-563a7e6d1ab0","resolution":{"observed_at":"2026-08-12T17:43:03.175123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.345748Z","title":"Video-llava: Learning united visual representa- tion by alignment before projection","venue":null,"work_id":"2d8a12c3-8c27-466e-8e8b-5d4a509cb5c6","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.180928Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:7df11e012a7231e4fb336e990775a1aa11b74d0db35a1a59bc8ec30e7bfae20c","observation_id":"66d3c174-85f9-447b-a60a-1f540dc777cb","resolution":{"observed_at":"2026-08-12T17:43:04.351160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T17:43:03.186135Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.186135Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:8c90836fd8f6718597bcbc46a5ee1ae2c9a002c5fa4612dd5e50e4ae30d9b1c7","observation_id":"c1e97409-d45b-42bf-98a6-7a84d74224b8","resolution":{"observed_at":"2026-08-12T17:43:03.186135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.328246Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"f37d5520-9a63-4ee7-bf8a-c7d0fc868054","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.191688Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:71648baa94bdd4f803da02b027366c93872f5780cc230550fd4c624991656e64","observation_id":"90fcb0c1-438f-463f-8bb4-6fd700a3c9d0","resolution":{"observed_at":"2026-08-12T17:43:04.333933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.310396Z","title":"Lawrence Zitnick","venue":null,"work_id":"0ad956e1-4d76-4ebb-a1f0-12a380e2c5a2","year":2014},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.196680Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:0fd80fc7f2958da719f3ecd9b25de6bfbca42a3569c921cf9ca321a4669f41c1","observation_id":"79bff67f-cb71-4e27-9c1b-2d75451d3a95","resolution":{"observed_at":"2026-08-12T17:43:04.315970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.203557Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.203557Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:6b5c5ab3305c70097bc074c722b7c23a47fbeb6dd7fc44f870745ee198e307ed","observation_id":"25d71ced-da19-4f2f-a516-afa49035b62f","resolution":{"observed_at":"2026-08-12T17:43:03.203557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-11T03:45:32.889856Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-12T17:43:03.208853Z","title":"World model on million-length video and language with blockwise ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.208853Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:005b4fcea51895c14b253312baead715434b4be1bdb6c9ff30598ff00b0aae64","observation_id":"de0d25fb-e774-4205-9732-0b5a640fbf72","resolution":{"observed_at":"2026-08-12T17:43:03.208853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15785","last_updated":"2024-06-27T12:05:48Z","snapshot_observed_at":"2026-08-13T10:03:47.236571Z","submitted_at":"2023-09-27T16:58:35Z","title":"BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15785","snapshot_observed_at":"2026-08-12T17:43:03.214641Z","title":"One for all: Video conversation is feasible without video instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.214641Z"},"links":{"cited_paper":"/paper/2309.15785","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:549dcbe93542c949734cb65b5291c736c56c773859a84524440b537038b0474f","observation_id":"60a8e0cb-1022-4047-a7ed-825647eab5e4","resolution":{"observed_at":"2026-08-12T17:43:03.214641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00308","last_updated":"2024-03-30T10:11:26Z","snapshot_observed_at":"2026-08-13T00:40:59.749269Z","submitted_at":"2024-03-30T10:11:26Z","title":"ST-LLM: Large Language Models Are Effective Temporal Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00308","snapshot_observed_at":"2026-08-12T17:43:03.220788Z","title":"ST-LLM: large language models are effective temporal learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.220788Z"},"links":{"cited_paper":"/paper/2404.00308","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:b5667bf3f242530461d3cf5109dab8ce8bf9cf135a56ae8ea7eef6fa31a77265","observation_id":"1593324f-320e-4af4-9cb9-cfc8b1ed7bc7","resolution":{"observed_at":"2026-08-12T17:43:03.220788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.226223Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.226223Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:49bb1bba243983c46cffed73718577eb64e15c8190eeac08e0e14fcb34fdcce9","observation_id":"2af014f9-11db-4cdd-aa50-d2a8f3d2c860","resolution":{"observed_at":"2026-08-12T17:43:03.226223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-12T17:43:03.231069Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.231069Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:ab91385dad431dd064bc26af992197c7f2635f85cd21600e25615ba9a0730ae0","observation_id":"2ffbb597-19fb-4961-93fd-8e4f31a16a59","resolution":{"observed_at":"2026-08-12T17:43:03.231069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.266465Z","title":"Some methods for classification and anal- ysis of multivariate observations","venue":null,"work_id":"f9f38a5f-7471-4f7b-ad39-73986b73a225","year":1967},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.236284Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:5b3857217208f53b4ef64d2d29745a86f6669ebda380571c0a3f3cb8906c095a","observation_id":"b8a8055a-73b3-44f0-91dd-8e70d97aa0ee","resolution":{"observed_at":"2026-08-12T17:43:04.272680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.248052Z","title":"Yuille, and Kevin Murphy","venue":null,"work_id":"c8a2b5ed-f9cb-4db7-8da8-128b5b2e7f95","year":2016},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.241058Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:148126606607bf53646c7f385621fa4596d5562b82883893f9aa4b3cac015cee","observation_id":"1f1405bd-bdfa-4a08-b6e1-179d714a455f","resolution":{"observed_at":"2026-08-12T17:43:04.253109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.245850Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.245850Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:09b0770cce37da5d2cd82c5ef1c18556e3628655146f18f4f5a5222ca2113814","observation_id":"fbd14a40-e224-4093-8831-e1162e9cf647","resolution":{"observed_at":"2026-08-12T17:43:03.245850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.219501Z","title":"Webvidqa: A large-scale dataset for video question answering","venue":null,"work_id":"28940367-b386-407a-b910-528d97e115a6","year":2021},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.251180Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:3d453c87b7851d591969a57dd1369592e98b95b3399eb5711c1d562285d2551f","observation_id":"ba16ab19-d20a-4e06-9572-00797ee7c6ab","resolution":{"observed_at":"2026-08-12T17:43:04.224590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.203850Z","title":"Introducing chatgpt","venue":null,"work_id":"e0c89c35-b7d4-432e-8574-e545774fb89a","year":2022},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.256692Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:13e58af40860ba42b2e077ece5ce10377bc5816a1bb4c9411074ef2d8169204a","observation_id":"6ea3099d-e5d3-48e4-be36-b99bf90505b1","resolution":{"observed_at":"2026-08-12T17:43:04.208955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.188250Z","title":"GPT-4o system card, 2024","venue":null,"work_id":"17e32fab-8cd1-4792-ae8a-688dcb68b67e","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.261844Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:f01be1b4675c1596549c1064a887caed256ca364527166b4d0be0675c86db7d5","observation_id":"b9e6b080-9048-43f3-8b18-406637cedd42","resolution":{"observed_at":"2026-08-12T17:43:04.192873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.172596Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"4ef6a94a-600e-47d0-8a8e-c0fa2e8b30df","year":2021},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.267235Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:39f643ce88142f4a6b82bd36843d5a31426bacee780aa8fcde14966fcde31bca","observation_id":"6ecae718-bdbf-4511-a75c-0ff1b842447e","resolution":{"observed_at":"2026-08-12T17:43:04.177914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.156885Z","title":"Improving language understanding by gener- ative pre-training","venue":null,"work_id":"1a8ed6ea-efc2-4ef3-8928-c9d6c5839174","year":2018},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.272111Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:ac8c4d5e148434bf7bb0ae7394da9527eedc92527b62661b308e7fdc01f5e195","observation_id":"b2a3c4cd-944a-46b1-a257-bab491b451bf","resolution":{"observed_at":"2026-08-12T17:43:04.162143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.140985Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":"bcd0a018-48cf-4c43-ac0d-05a828a0aca5","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.277089Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:e10c3db37a9fb6795063e7f1c55f5fdccf8cbc933d1a07930e6d638d4f52dec0","observation_id":"80ab209e-d25d-468f-b4f5-f2c99e816a88","resolution":{"observed_at":"2026-08-12T17:43:04.146210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.124156Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"1c963c74-3a2e-494c-8ea0-fae2dbdc7e41","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.281962Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:3bec4f5f4055438ba35330c25a94dab8f9547b298424b06298e4e9030b8f5c01","observation_id":"849ce177-89ab-4c57-84b2-263947569873","resolution":{"observed_at":"2026-08-12T17:43:04.129764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.106432Z","title":"Massof Sarah L","venue":null,"work_id":"77529eac-98a5-4b39-8490-0a63a1a37412","year":2021},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.288087Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:5e5de92cfe500a8f445102a16c068202ffa1aa26d5a7430366a0c4df40ec1f15","observation_id":"c8db052f-139d-4721-92db-375d350333a0","resolution":{"observed_at":"2026-08-12T17:43:04.112583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.090060Z","title":"A-okvqa: A bench- mark for visual question answering using world knowledge","venue":null,"work_id":"f7e971e2-86d0-4bb6-b544-0b1b79c904bc","year":2022},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.292697Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:ba414865ba4e33596e414d388d4a6ebab8aa957c0fb0e09dde440420e0a2808a","observation_id":"e74eb7fb-e81a-4a1a-aedb-f5c5f9d1a06d","resolution":{"observed_at":"2026-08-12T17:43:04.095257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.073266Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"3d237e96-a50b-4cd4-96bf-38aa45599483","year":2018},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.297505Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:7312660e14ed195120e82529f254e61ee0cb82d0da0529bfefdf5fbb2f95f112","observation_id":"35c00115-a116-4de1-9640-eabf185e24a1","resolution":{"observed_at":"2026-08-12T17:43:04.078763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.052443Z","title":"Textcaps: a dataset for image captioning with reading comprehension","venue":null,"work_id":"225d72af-0aac-498d-bfe1-be39df72c9fd","year":2020},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.302047Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:0ba9925501bb37d98cba26a8d4ce3129b4b6ee89bf6411fc5dacb391690ae246","observation_id":"04cbea46-a537-4ccb-a7c1-a20ce0943b2b","resolution":{"observed_at":"2026-08-12T17:43:04.059597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16449","last_updated":"2024-03-09T06:43:37Z","snapshot_observed_at":"2026-08-13T10:44:25.209833Z","submitted_at":"2023-07-31T07:15:45Z","title":"MovieChat: From Dense Token to Sparse Memory for Long Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16449","snapshot_observed_at":"2026-08-12T17:43:03.306611Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.306611Z"},"links":{"cited_paper":"/paper/2307.16449","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:c14e3e6db54cab5f2b818709722466c4ed0b79aa08182f06c03fce58c3df5063","observation_id":"07fcd0e9-4a9d-48f4-913e-16a82ba77ff9","resolution":{"observed_at":"2026-08-12T17:43:03.306611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.032303Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"92286974-509a-4f92-af9c-6804b46e88ea","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.311747Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:aa17b0d951b8dc05a6055c64ea0d2bbc43ef0fcad3ae55bf27733669b9f371ea","observation_id":"244acf83-61ea-4a6b-9dd9-53248aa8ebca","resolution":{"observed_at":"2026-08-12T17:43:04.038794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01422","last_updated":"2025-08-11T12:47:49Z","snapshot_observed_at":"2026-08-13T04:04:45.669973Z","submitted_at":"2024-03-03T07:43:39Z","title":"DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01422","snapshot_observed_at":"2026-08-12T17:43:03.316445Z","title":"Moviellm: Enhancing long video understanding with ai-generated movies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.316445Z"},"links":{"cited_paper":"/paper/2403.01422","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:fe5c9fe76fb6120600da86abce516585be4690ff853f88453bb3cd03ad33b92b","observation_id":"adc1f000-41c0-4e15-beea-8be646f352d0","resolution":{"observed_at":"2026-08-12T17:43:03.316445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T17:43:03.321491Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.321491Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:f63fe3260e7303519490cb385a55b520e0ba67c7bab7bf7ac0531c21f630c790","observation_id":"f27cfd0f-7d32-4381-9795-91a3214f24e6","resolution":{"observed_at":"2026-08-12T17:43:03.321491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.014741Z","title":"Ocrvqa: A new dataset for optical character recognition in visual question answering","venue":null,"work_id":"d40c9e40-51d3-450d-85b0-5893dcecad37","year":2018},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.326429Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:aea40b7284bd167d5ce9e536298137cdf63b74162906baf5c6f438469a6c00b6","observation_id":"43a75b67-c0a8-435b-9aac-d5c43325d460","resolution":{"observed_at":"2026-08-12T17:43:04.020499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-12T17:43:03.331072Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.331072Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:0d6f29f75cb6366f7b869edbad2fb108e96dc25ae01d55f600bcb657206a7350","observation_id":"7e892c22-933f-4318-965b-dc19ed6cf8a9","resolution":{"observed_at":"2026-08-12T17:43:03.331072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16338","last_updated":"2024-06-24T06:21:59Z","snapshot_observed_at":"2026-08-12T23:36:27.585760Z","submitted_at":"2024-06-24T06:21:59Z","title":"VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16338","snapshot_observed_at":"2026-08-12T17:43:03.336459Z","title":"Videohallucer: Evaluating intrinsic and ex- trinsic hallucinations in large video-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.336459Z"},"links":{"cited_paper":"/paper/2406.16338","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:7a8dedb7bb96f9bcea3e38e8a9d545f1f75511c01188d9a8ab02b68062edba93","observation_id":"97f740c3-73c6-4c9e-8958-67f8bdfdf36e","resolution":{"observed_at":"2026-08-12T17:43:03.336459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.997911Z","title":"Videollamb: Long video understanding with recurrent mem- ory bridges","venue":null,"work_id":"9ec7736f-9473-4841-aeed-f5e36c13a6ed","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.341593Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:444aabd8e40996fd437d3ae0fa129ef4d8c7b45948a202b12a141c6ff4d988e5","observation_id":"bd29c8d1-fd60-4a56-b0ad-e2dc3962211b","resolution":{"observed_at":"2026-08-12T17:43:04.003342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07798","last_updated":"2024-06-10T13:55:21Z","snapshot_observed_at":"2026-08-13T00:08:51.202655Z","submitted_at":"2024-05-13T14:42:13Z","title":"FreeVA: Offline MLLM as Training-Free Video Assistant","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07798","snapshot_observed_at":"2026-08-12T17:43:03.346619Z","title":"Freeva: Offline MLLM as training-free video assistant","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.346619Z"},"links":{"cited_paper":"/paper/2405.07798","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:31518b86c0012798a51a79a25d3b69538539f9b90ea2a1ae9c86eda4773755ba","observation_id":"cc9702e0-bbdb-40bd-a4b7-33a4e5b83220","resolution":{"observed_at":"2026-08-12T17:43:03.346619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.981054Z","title":"Davis, Kristen Grauman, and Rog´erio Schmidt Feris","venue":null,"work_id":"0ffa4105-1c60-4dec-ab33-948cedf7f307","year":2018},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.352245Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:905732973b56dcc374885078f50b7db6ee616c961db4dfae82d5dad582d5b505","observation_id":"0d789eab-03a8-4918-a2c7-8a4e8d87ea3a","resolution":{"observed_at":"2026-08-12T17:43:03.986333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.964245Z","title":"Deep learning for video classification and captioning","venue":null,"work_id":"cb656d8e-fe7f-48c4-89a5-f259e9cc76d9","year":2017},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.356916Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:b6bae916d725b47c60dae7553804a160d1034b9fa110b2bcb5ebe7cef8a9c7ee","observation_id":"c824db95-0761-4a49-8aef-c606a9170226","resolution":{"observed_at":"2026-08-12T17:43:03.969334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.361819Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.361819Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:e52945ab66a3b42a52930f723eed6ec3d49f40058f1df3eb7a4723c1324a1aca","observation_id":"b0b61000-7204-46e3-9c89-70cbe5eb90f7","resolution":{"observed_at":"2026-08-12T17:43:03.361819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.935726Z","title":"MSR-VTT: A large video description dataset for bridging video and language","venue":null,"work_id":"5628d046-7cbd-4bb8-a525-ab5d52d66c3a","year":2016},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.366481Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:27d55eb4f704f78ba5d52abe670c15b3090cc6a8d733247c4bad4cb27a1c1a13","observation_id":"b417a12e-c613-4623-b461-5dcfb2fc48c0","resolution":{"observed_at":"2026-08-12T17:43:03.940819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-12T17:43:03.371221Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.371221Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:3150f80787a2fa543e14d823943819a97dfac9c1a4ec9590c1a7e1367f4f6f72","observation_id":"580d49b8-86fd-4237-b6e6-0aaf0f50a8b1","resolution":{"observed_at":"2026-08-12T17:43:03.371221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-12T17:43:03.376477Z","title":"Clevrer: Collision events for video representation and reasoning.arXiv preprint arXiv:1910.01442, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.376477Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:606a8ebfd4faf877182dc93ae83b7c3bf082d63d389b01a133f23ae1a644474e","observation_id":"0886b48f-09a5-4d1f-a63a-4601f2da034d","resolution":{"observed_at":"2026-08-12T17:43:03.376477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.919198Z","title":"Tenenbaum","venue":null,"work_id":"4299cf58-964a-4721-8b0d-5d517b8909be","year":2020},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.381552Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:d53c540cc0d380cf9f0279a2285c20c934fccad563e5077fdb849467cecb43c4","observation_id":"86ed1b74-7c25-43e6-9888-5a20b69ec836","resolution":{"observed_at":"2026-08-12T17:43:03.924319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T17:43:03.386720Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.386720Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:9cf6e25095a6cdce9f08c9c329e721368f8ef0593a1e0f2372e7feae562cc617","observation_id":"ac5110db-7965-434d-a3c8-be105974b135","resolution":{"observed_at":"2026-08-12T17:43:03.386720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-13T01:15:12.087659Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-08-12T17:43:03.391576Z","title":"Flash-vstream: Memory- based real-time understanding for long video streams","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.391576Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:31456ed7eac4261b59a6f544801dff8d280ff545a2d587ffbe26e4795a88bceb","observation_id":"5cbfdf1e-ed6a-4579-8036-f4c7b9d9ea87","resolution":{"observed_at":"2026-08-12T17:43:03.391576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.900651Z","title":"Llama- adapter: Efficient fine-tuning of language models with zero- init attention","venue":null,"work_id":"53285447-3c9b-413f-9a2e-367cc5d31c72","year":2023},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.396276Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:a91276183c59dbfe66333400b415500465b1f244e6ebd4d8150c3ef81c2a3501","observation_id":"f67af649-7e95-4e51-9057-9c8392cd8a03","resolution":{"observed_at":"2026-08-12T17:43:03.906623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:03.880461Z","title":"Please Carefully Think","venue":null,"work_id":"844b2ec3-e896-4270-b50f-5fd43a489fd7","year":2024},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.400998Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:2db02ea8074916eb95ef628e8a207645e49671692151e83cfea193b9ce426068","observation_id":"f7d1270e-acba-4a7c-b2a9-061431d94cc9","resolution":{"observed_at":"2026-08-12T17:43:03.887845Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:43:04.711793Z","title":null,"venue":null,"work_id":"be22713c-7f7f-4c33-92c4-26541cfdf1d0","year":2011},"citing_paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding","version":2},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-08-12T17:43:03.042499Z"},"links":{"citing_paper":"/paper/2411.12355"},"observation_digest":"sha256:da30c7fc8683fcd9f307a57c6a6b27d42e602968682b712cbe77fc3c27127b30","observation_id":"831ab334-8259-405f-a2cb-5c78bfdc1331","resolution":{"observed_at":"2026-08-12T17:43:04.719668Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12355","last_updated":"2025-03-25T10:31:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T00:47:50.605727Z","submitted_at":"2024-11-19T09:16:54Z","title":"DynFocus: Dynamic Cooperative Network Empowers LLMs with Video Understanding"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2411.12355."}