{"as_of":"2026-08-14T14:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68e22265dbb8b64c57b88abc4ef1ca6f820a82e3b75610eb64589e9fbb261872","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T03:51:25.396887Z","state":"measured"},{"denominator":119,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":119,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":87,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:42:55.931881Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T10:48:02.935874Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-12T16:42:55.931881Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13281","last_updated":"2025-03-23T11:01:22Z","snapshot_observed_at":"2026-08-12T23:07:06.477974Z","submitted_at":"2024-11-20T12:48:34Z","title":"VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T16:42:55.931881Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2411.13281"},"observation_digest":"sha256:ef4da62d7e522f128d249db2a54c7bc5150997c8b661669f12f8de5d311f2a1c","observation_id":"94698ba4-ab28-4e1a-8f5d-e9bab638eed4","resolution":{"observed_at":"2026-08-12T16:42:55.931881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-12T13:36:44.137558Z","title":"Longvila: Scaling long-context visual language models for long videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16102","last_updated":"2026-06-05T23:07:54Z","snapshot_observed_at":"2026-08-13T13:55:22.766527Z","submitted_at":"2024-11-25T05:24:53Z","title":"BlendServe: Optimizing Offline Inference for Auto-regressive Large Models with Resource-aware Batching","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T13:36:44.137558Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2411.16102"},"observation_digest":"sha256:23554d6786bfc0a276b283d2e6b03e27ddd37e41e1d557ee429e1f71cf277554","observation_id":"b516edaa-cfb4-4a59-ade6-277f40e74f61","resolution":{"observed_at":"2026-08-12T13:36:44.137558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-12T13:31:04.502907Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16173","last_updated":"2025-03-21T10:44:15Z","snapshot_observed_at":"2026-08-13T18:43:31.805845Z","submitted_at":"2024-11-25T08:04:47Z","title":"SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T13:31:04.502907Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2411.16173"},"observation_digest":"sha256:a99dadc5d3f9e724113c3c86a3024ce319ab040527d8cd32c26b6b67863edcef","observation_id":"b221bf69-f184-4f8b-b50b-59585d1ed87a","resolution":{"observed_at":"2026-08-12T13:31:04.502907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-12T11:19:33.872055Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-13T21:40:49.922514Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.872055Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:f30f4d378fa9fbbdec8826a4eaf56172e43c3cec01e265dc154edcadb86e8eb5","observation_id":"b24a736c-29db-4215-baa7-c81b097b72d5","resolution":{"observed_at":"2026-08-12T11:19:33.872055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-12T04:56:01.474234Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00927","last_updated":"2024-12-01T18:27:28Z","snapshot_observed_at":"2026-08-12T08:24:05.073442Z","submitted_at":"2024-12-01T18:27:28Z","title":"VISTA: Enhancing Long-Duration and High-Resolution Video Understanding by Video Spatiotemporal Augmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T04:56:01.474234Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.00927"},"observation_digest":"sha256:b8a5682fd307a5b3286df0c5719c53b082e656ddc460a8ab93414237f4aed3d5","observation_id":"e6c7d9bd-4841-488b-97db-f65a854fa955","resolution":{"observed_at":"2026-08-12T04:56:01.474234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-11T22:42:34.850695Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-08-13T16:22:58.684207Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T22:42:34.850695Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.03248"},"observation_digest":"sha256:91309d270cf814739e9168b8e6a69e95db8ad3f82763fa4c1b4badcb2abedca9","observation_id":"071fcb59-3f8e-4437-acd7-d53341c590dc","resolution":{"observed_at":"2026-08-11T22:42:34.850695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:625b877d91d66a84fe447305c47f555a77fedd4cb325383a31f082731387ea96","observation_id":"ea14d6be-01bf-48f9-b97d-92803853f4b6","resolution":{"observed_at":"2026-05-23T07:42:43.247372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-11T20:54:16.556012Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05185","last_updated":"2024-12-11T14:43:02Z","snapshot_observed_at":"2026-08-12T09:36:58.123071Z","submitted_at":"2024-12-06T17:04:42Z","title":"LinVT: Empower Your Image-level Large Language Model to Understand Videos","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T20:54:16.556012Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.05185"},"observation_digest":"sha256:8e46930b32a6e315425b00565c19a81560709acf3a624c6b5d61f1ea404491ee","observation_id":"7d32a76d-932e-4a78-aa7a-52758bd63697","resolution":{"observed_at":"2026-08-11T20:54:16.556012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-11T16:58:03.571836Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09616","last_updated":"2024-12-13T04:58:33Z","snapshot_observed_at":"2026-08-14T10:47:04.513264Z","submitted_at":"2024-12-12T18:59:46Z","title":"V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding","version":2},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-08-11T16:58:03.571836Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.09616"},"observation_digest":"sha256:7184a817c04db246cb5914fdbeb0655eb14955067f6aa47acd0d8d9d40fcf157","observation_id":"1565d455-bcb9-44bc-bbf5-f81d2e97bc0d","resolution":{"observed_at":"2026-08-11T16:58:03.571836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-11T16:39:51.002585Z","title":"LongVILA: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09907","last_updated":"2024-12-16T03:04:33Z","snapshot_observed_at":"2026-08-14T07:02:02.023876Z","submitted_at":"2024-12-13T06:52:02Z","title":"IQViC: In-context, Question Adaptive Vision Compressor for Long-term Video Understanding LMMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T16:39:51.002585Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.09907"},"observation_digest":"sha256:f1e7768ca91ebdc60ed6f10c5568c8662e1ea8b2b4c4605a427cdfda2b6352d1","observation_id":"18562d97-8e0a-4fd6-ba9e-ff9b5af20b43","resolution":{"observed_at":"2026-08-11T16:39:51.002585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-11T14:22:51.041669Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12075","last_updated":"2024-12-16T18:46:45Z","snapshot_observed_at":"2026-08-13T05:16:24.913588Z","submitted_at":"2024-12-16T18:46:45Z","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:22:51.041669Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.12075"},"observation_digest":"sha256:39115d91bd620a558359ed7482aa9ed02d08abdd0fd4522357c31d1f834a703d","observation_id":"b9587f3f-bdc5-4272-8752-2b9c817eaaea","resolution":{"observed_at":"2026-08-11T14:22:51.041669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-11T13:52:57.193369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12735","last_updated":"2024-12-17T09:57:21Z","snapshot_observed_at":"2026-08-12T09:37:12.451097Z","submitted_at":"2024-12-17T09:57:21Z","title":"GIRAFFE: Design Choices for Extending the Context Length of Visual Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:57.193369Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.12735"},"observation_digest":"sha256:2f70dc2530cb46fe9b07625e1ca4db4c362f8cc793bf3c3fb62934c54fdebde5","observation_id":"242a68af-21f3-40db-b0b2-456ba3e78a2a","resolution":{"observed_at":"2026-08-11T13:52:57.193369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-10T08:02:13.965614Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-22T09:27:43.919941Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2412.14171"},"observation_digest":"sha256:fe68a5a31187e82f6f783d9ba365a47214b16a211a19d63b19c47751434183bb","observation_id":"5f1a4405-493e-49cb-9d05-c54036e8e2ef","resolution":{"observed_at":"2026-05-22T09:27:43.998546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T04:02:43.261543Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2501.00574"},"observation_digest":"sha256:ed322ca681a24dba4ed03d93cfddb366239432b2c856e42a41bf6b6fed03765d","observation_id":"a100e30c-9c51-4c45-9148-50e2b78a265e","resolution":{"observed_at":"2026-05-18T04:02:43.569786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"reference_index":227,"source":"pdf_text","source_observed_at":"2026-05-10T23:38:44.933410Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2501.03575"},"observation_digest":"sha256:cde08e6fd60398b969cce44078787a57781f8809e544d5c684b653c8b612dac6","observation_id":"b9e8cedf-e6b2-431a-b91a-31560e1cfde3","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-10T21:23:58.026866Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05037","last_updated":"2025-03-27T09:39:11Z","snapshot_observed_at":"2026-08-13T13:30:15.151225Z","submitted_at":"2025-01-09T07:51:14Z","title":"LongViTU: Instruction Tuning for Long-Form Video Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T21:23:58.026866Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2501.05037"},"observation_digest":"sha256:9db551feaf9bd8eae17a45a9ae18f25e81c7f22d732366bd99b083295bbc2c60","observation_id":"6a07cc5f-fb89-4dc3-ab11-3c6d811ce8cb","resolution":{"observed_at":"2026-08-10T21:23:58.026866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-10T20:33:22.822399Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.08248","last_updated":"2025-06-09T07:37:32Z","snapshot_observed_at":"2026-08-13T12:25:46.254885Z","submitted_at":"2025-01-14T16:38:33Z","title":"Eliciting In-context Retrieval and Reasoning for Long-context Large Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:22.822399Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2501.08248"},"observation_digest":"sha256:c8d4bcf03cf0b0e930d4471fa4c24402d7e71adc6fc98fda3160dc63651d6658","observation_id":"9383ea64-b995-442b-96be-1c8be2918c18","resolution":{"observed_at":"2026-08-10T20:33:22.822399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:d5e7fa31e5f80d00b4547e90df2907cfb3be9bc20fce05e781dbf26a36279c87","observation_id":"e2170d37-63ab-44c0-b67a-6e242c29aca4","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-08T16:36:00.816958Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06155","last_updated":"2025-02-17T07:08:23Z","snapshot_observed_at":"2026-08-10T08:45:38.806056Z","submitted_at":"2025-02-10T05:00:56Z","title":"Efficient-vDiT: Efficient Video Diffusion Transformers With Attention Tile","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T16:36:00.816958Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2502.06155"},"observation_digest":"sha256:fd0f55886e2de887ee35571046fb9f6731bf6d5dfe59f3d3685d521aeb524fb5","observation_id":"d942cf6c-18c6-4c23-948e-73da7d12d445","resolution":{"observed_at":"2026-08-08T16:36:00.816958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-08T15:31:16.983567Z","title":"Longvila: Scaling long- context visual language models for long videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-11T01:32:36.892918Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T15:31:16.983567Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2502.06428"},"observation_digest":"sha256:75353aa47b0d58fb19dd3922c237b8e406bd2b37682668fd380a814359ad7c8e","observation_id":"01335963-1e98-4664-9da6-dd7359c035fd","resolution":{"observed_at":"2026-08-08T15:31:16.983567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-08T12:25:42.741468Z","title":"LongVILA: Scal- ing long-context visual language models for long videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07563","last_updated":"2025-02-11T14:01:39Z","snapshot_observed_at":"2026-08-08T12:15:35.512720Z","submitted_at":"2025-02-11T14:01:39Z","title":"LASP-2: Rethinking Sequence Parallelism for Linear Attention and Its Hybrid","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:42.741468Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2502.07563"},"observation_digest":"sha256:c9169895d0dbb818874a13c359bd8dde3ea30446e663976916345b09898507d9","observation_id":"ab372280-d145-4bd1-91db-11abde4aaaf2","resolution":{"observed_at":"2026-08-08T12:25:42.741468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T20:31:15.700943Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.13211"},"observation_digest":"sha256:7f1f541c36bf1fb46c42da70a5035e3f9412382cd73860c286e13c8f5b089f03","observation_id":"5387d609-cfcc-483f-b3da-0427aa9013b8","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T15:34:40.848837Z","title":"Longvila: Scaling long-context visual language models for long videos.arXiv preprint arXiv:2408.10188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14640","last_updated":"2025-05-20T17:26:32Z","snapshot_observed_at":"2026-08-13T16:34:59.517866Z","submitted_at":"2025-05-20T17:26:32Z","title":"VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:40.848837Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.14640"},"observation_digest":"sha256:1b27ada110757e1024baa192c12a69932ee38335c1548bab039f9c308b75369f","observation_id":"f52197b2-3d0b-4a6e-8276-e907aa5a7935","resolution":{"observed_at":"2026-08-07T15:34:40.848837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T15:20:47.582468Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-14T02:24:45.804660Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:47.582468Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:ed090d97e982ea5c6a8b93e97e2c0e6ecc15cd76a7e5f74f06e9e9d5f6c54cb8","observation_id":"504d6f4d-54f0-4a77-8703-264b2636ec34","resolution":{"observed_at":"2026-08-07T15:20:47.582468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T15:15:12.159249Z","title":"Longvila: Scaling long- context visual language models for long videos.arXiv preprint arXiv:2408.10188,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15816","last_updated":"2025-05-21T17:59:52Z","snapshot_observed_at":"2026-08-12T14:43:39.565056Z","submitted_at":"2025-05-21T17:59:52Z","title":"Streamline Without Sacrifice -- Squeeze out Computation Redundancy in LMM","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:12.159249Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.15816"},"observation_digest":"sha256:b9a2b542ad14f3f824ea2dca5442f3d382c69f9ba15e03ef85291bed9b4e10be","observation_id":"cccd9eeb-d8cc-44b5-a363-03d7c376bcdd","resolution":{"observed_at":"2026-08-07T15:15:12.159249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T14:46:02.442537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17654","last_updated":"2026-05-27T08:26:10Z","snapshot_observed_at":"2026-08-13T04:58:51.991251Z","submitted_at":"2025-05-23T09:18:01Z","title":"EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:02.442537Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.17654"},"observation_digest":"sha256:27b43f31867a38668931b95d7ba8d7ca5cdd1cf816917e2e826b96bbbdd7d5ea","observation_id":"a4ba363a-5032-4daa-a114-44dd7d18c80d","resolution":{"observed_at":"2026-08-07T14:46:02.442537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-08-12T18:05:43.082727Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T08:34:36.824053Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:87b85b28d625236b7afb46918fafbcc263e55a0c1f40e204986b0a2e3b00844d","observation_id":"5fe79650-f316-4e3d-a8fc-6f3cc3a44e93","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-08-12T18:05:43.082727Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-22T00:59:13.826054Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:36b28dbc5541ce9b0ed310c75dd7593d5bde92d36e5cf25660a48bce4b6864af","observation_id":"2509b013-fa07-4a8d-a82d-2f87c2901745","resolution":{"observed_at":"2026-05-22T01:00:51.343379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T12:37:16.941581Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24158","last_updated":"2025-05-30T03:04:28Z","snapshot_observed_at":"2026-08-13T08:55:49.115006Z","submitted_at":"2025-05-30T03:04:28Z","title":"Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:16.941581Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.24158"},"observation_digest":"sha256:b727254e47ebb903b1757f8cd8ac1a6307f987887187aa09a5fec88be3ee1686","observation_id":"27e4ed29-6118-42b5-b76a-559978453cd2","resolution":{"observed_at":"2026-08-07T12:37:16.941581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T12:35:19.402144Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24257","last_updated":"2025-05-30T06:32:26Z","snapshot_observed_at":"2026-08-09T16:57:27.213555Z","submitted_at":"2025-05-30T06:32:26Z","title":"Out of Sight, Not Out of Context? Egocentric Spatial Reasoning in VLMs Across Disjoint Frames","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:19.402144Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.24257"},"observation_digest":"sha256:5483bd6cc3fd4626d910989d16e061ec31429d6b6806493486a1e1612d00c0bf","observation_id":"1a27a710-b5f4-41e5-9d5d-e78a4c032497","resolution":{"observed_at":"2026-08-07T12:35:19.402144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T11:59:05.898445Z","title":"Longvila: Scaling long-context visual language models for long videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.898445Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:b844f5a1bba356bc51ae62f32c45347eebbfbb702984bb2ba9fd70a876e7458f","observation_id":"6fbfa54c-6909-484a-814c-ee2ecabe4087","resolution":{"observed_at":"2026-08-07T11:59:05.898445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T11:42:34.565742Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01608","last_updated":"2025-08-25T13:46:38Z","snapshot_observed_at":"2026-08-08T05:44:19.558373Z","submitted_at":"2025-06-02T12:46:44Z","title":"EPFL-Smart-Kitchen-30: Densely annotated cooking dataset with 3D kinematics to challenge video and language models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:42:34.565742Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.01608"},"observation_digest":"sha256:2582e1c5a79dd4a169fec15ff7cf1151cb1081e514ef2451ca1b3d41654176af","observation_id":"388f79e1-50ab-4210-b808-69698edb3de7","resolution":{"observed_at":"2026-08-07T11:42:34.565742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T10:56:05.389890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.389890Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:55129ced2d3d3a82b525d053c1bdc980581c8a8e42705063185344792c9f16d4","observation_id":"b80eb3c8-54d4-45d1-975d-01eed4caa809","resolution":{"observed_at":"2026-08-07T10:56:05.389890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T10:51:42.980673Z","title":"Longvila: Scaling long-context visual language models for long videos.arXiv preprint arXiv:2408.10188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04216","last_updated":"2025-06-04T17:57:43Z","snapshot_observed_at":"2026-08-14T01:59:47.398416Z","submitted_at":"2025-06-04T17:57:43Z","title":"UNIC: Unified In-Context Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:51:42.980673Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.04216"},"observation_digest":"sha256:f694215f9f18798491fbf14defaac97fc1d97fa8ff203ca4d8cbeb5e5d324c02","observation_id":"6e0288bf-ef1a-4adb-b60c-c54ecd6bf42a","resolution":{"observed_at":"2026-08-07T10:51:42.980673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T10:35:18.818281Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-14T05:02:18.401849Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.818281Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:e034444dda355bab198820fc877e421729fd84f836a8d7c1826efdede9c1f57a","observation_id":"90256300-b541-4ad1-a4c1-06973ecb44f1","resolution":{"observed_at":"2026-08-07T10:35:18.818281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T05:49:53.411481Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.411481Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:6c402d231b2d9d3247263039ab818f5a5b6f29cb3ec6c14564f66bdff852c6d6","observation_id":"ea34d88d-cd06-4fee-838a-1704492c1e8c","resolution":{"observed_at":"2026-08-07T05:49:53.411481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T04:20:30.765313Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T17:11:06.528222Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:30.765313Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:2b809f2e3887821cf201a73dd93f23fce6878b1e4dde197a7f834584a247b261","observation_id":"38da4126-715b-4717-a507-f8506b4447bf","resolution":{"observed_at":"2026-08-07T04:20:30.765313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T00:34:28.324818Z","title":"Longvila: Scaling long-context visual language models for long videos.arXiv preprint arXiv:2408.10188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-13T10:18:19.034825Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:28.324818Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:fda37953036daefc10130a71a236c866fdea7c21bcd99316bfecf0b436a4ad47","observation_id":"e82aa700-434c-4361-b9f2-dc66b162c905","resolution":{"observed_at":"2026-08-07T00:34:28.324818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-06T23:13:10.317216Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-14T14:43:02.885779Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:10.317216Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:2646d9fb61cad994afa5bc472b25393c11b124c171bf3f1b734a0467c0d4eea8","observation_id":"4ef0ce03-ebad-4ebd-8418-b74ff83892fe","resolution":{"observed_at":"2026-08-06T23:13:10.317216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-06T22:15:04.382683Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.382683Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:7a6bbe536adc01e3a69c936f74e86b7ab0e7ba8da830aa04a286a111ebf0baf6","observation_id":"a4b2f519-101d-44cc-af46-640da2b1c2df","resolution":{"observed_at":"2026-08-06T22:15:04.382683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-06T21:37:08.873755Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23825","last_updated":"2025-07-24T07:25:10Z","snapshot_observed_at":"2026-08-14T13:48:33.004337Z","submitted_at":"2025-06-30T13:17:49Z","title":"Flash-VStream: Efficient Real-Time Understanding for Long Video Streams","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.873755Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.23825"},"observation_digest":"sha256:b4766d4f5ca450ea3945084b9c6479b3984e2ad5addacd2bcc25fbf25c31c29a","observation_id":"93c29c6b-51ce-4a07-9a67-99f57cf17501","resolution":{"observed_at":"2026-08-06T21:37:08.873755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-06T20:29:55.468866Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:55.468866Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:eb941eca8cfb16b7549edfe8b32f0128ac7c8eb71f153c0cbbb0b3d0628d500d","observation_id":"7d5a20d2-bc5b-4ea3-b24e-2cd0facb5bf6","resolution":{"observed_at":"2026-08-06T20:29:55.468866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T03:42:44.523919Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2507.08128"},"observation_digest":"sha256:da4272635dc1202aecc006dd57d43b641cb03c5388c1bbaf3952a7cd50a5a486","observation_id":"ee615172-d0e8-4d34-9f80-f1e44dcfb74a","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-06T18:09:18.313230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09068","last_updated":"2025-07-23T13:06:44Z","snapshot_observed_at":"2026-08-11T10:43:34.020108Z","submitted_at":"2025-07-11T23:07:04Z","title":"Infinite Video Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:09:18.313230Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2507.09068"},"observation_digest":"sha256:216787689d7533d3a1a724374ee80cca2c8c144ef21fba092dbbbc0717581c53","observation_id":"339e7bb3-dc67-4a6f-8af4-aff75a9dfa3c","resolution":{"observed_at":"2026-08-06T18:09:18.313230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-05T19:03:10.656199Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-13T22:53:42.934950Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:10.656199Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:ac0e1a6e17caa3a93fa6354f191b33b2ef99eccdc184d40fdabbc340523595fa","observation_id":"c56e3819-24d1-4035-b1c7-27b463c20ac3","resolution":{"observed_at":"2026-08-05T19:03:10.656199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-05T15:10:16.712705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20478","last_updated":"2026-05-29T09:48:44Z","snapshot_observed_at":"2026-08-13T15:21:09.096016Z","submitted_at":"2025-08-28T06:55:08Z","title":"Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T15:10:16.712705Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2508.20478"},"observation_digest":"sha256:57cffdf8ea67bd97ea35fcfac1c8cba479246535449ecff3ad20efc0289b647e","observation_id":"4c43c753-2702-410d-bea7-f066b6126247","resolution":{"observed_at":"2026-08-05T15:10:16.712705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-05T14:41:15.525180Z","title":"In Proceedings of the Computer Vision and Pattern Recognition Conference, 9392–9401","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21044","last_updated":"2025-08-28T17:50:03Z","snapshot_observed_at":"2026-08-13T12:39:55.957082Z","submitted_at":"2025-08-28T17:50:03Z","title":"MMG-Vid: Maximizing Marginal Gains at Segment-level and Token-level for Efficient Video LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T14:41:15.525180Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2508.21044"},"observation_digest":"sha256:98f4828b09b250b29104dd678e9019353b73c104cc511547da9b39898fd95edf","observation_id":"09ded1e6-3c85-45f7-881a-d26649f03049","resolution":{"observed_at":"2026-08-05T14:41:15.525180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-05T13:54:52.015747Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00210","last_updated":"2025-08-29T19:47:25Z","snapshot_observed_at":"2026-08-14T02:37:22.845945Z","submitted_at":"2025-08-29T19:47:25Z","title":"Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T13:54:52.015747Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2509.00210"},"observation_digest":"sha256:376875f5310722f5456fd27e8c2205666a43865e9d27454da6da5ee5fc692d93","observation_id":"1de4e52f-cc90-4a48-85e1-263603334207","resolution":{"observed_at":"2026-08-05T13:54:52.015747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-04T19:28:34.352539Z","title":"Longvila: Scaling long-context visual language models for long videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-11T00:06:42.054152Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.352539Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:12b109c07f6bd8f91ab8c7cf92ccb756f4447e4d089f44ff23212ba85bc7c9e5","observation_id":"efb52306-5104-48a7-aef7-4735da755979","resolution":{"observed_at":"2026-08-04T19:28:34.352539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2601.15724","last_updated":"2026-04-19T09:17:00Z","snapshot_observed_at":"2026-08-13T23:11:17.607349Z","submitted_at":"2026-01-22T07:47:29Z","title":"VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T12:17:42.135851Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2601.15724"},"observation_digest":"sha256:14ae805a80b14847f2a2ca31a8d6f0eba2fe4601052e0452e495dedebad63582","observation_id":"bfb80cbe-af67-4928-af62-45ab11c8a3cf","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-03T06:50:28.622236Z","title":"Longvila: Scaling long-context visual language models for long videos.ArXiv, abs/2408.10188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:28.622236Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:e3609d45251020fda969317f534e933c4384c5e07d4dd589b0c95af91edb60ae","observation_id":"53f3abd4-b80e-44cb-9b3c-03b818c2f57d","resolution":{"observed_at":"2026-08-03T06:50:28.622236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-02T17:54:04.513726Z","title":"arXiv preprint arXiv:2408.10188 (2024) 11","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.19235","last_updated":"2026-07-17T06:42:00Z","snapshot_observed_at":"2026-08-14T02:16:35.171898Z","submitted_at":"2026-03-19T17:59:58Z","title":"Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T17:54:04.513726Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2603.19235"},"observation_digest":"sha256:42b0bbcbbc8248831277231f88b2b80ff65f0653d67d513b3281aeeb920bee65","observation_id":"0359ec22-6c24-4a19-9de9-8416ba0dd06c","resolution":{"observed_at":"2026-08-02T17:54:04.513726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2603.27437","last_updated":"2026-05-02T17:42:29Z","snapshot_observed_at":"2026-08-13T10:32:18.542608Z","submitted_at":"2026-03-28T22:49:40Z","title":"SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T22:04:18.591594Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2603.27437"},"observation_digest":"sha256:74f3dfcfb73a66085d47568e779bc415e18c51d0d0297049a5a03d340d8b089e","observation_id":"10c6e27b-b2b5-4a5e-9fd6-39b89f3ecc79","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2604.02371","last_updated":"2026-06-29T16:52:45Z","snapshot_observed_at":"2026-08-11T00:23:10.170872Z","submitted_at":"2026-03-31T04:41:01Z","title":"Internalized Reasoning for Long-Context Visual Document Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T23:53:19.148407Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2604.02371"},"observation_digest":"sha256:d6cbe5e676a02027d4510f7c76ec8e6a2678ed0977eab4994bf4c9803d9231ae","observation_id":"191946bd-210a-474b-a7e3-1cc0d365ad4c","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-13T15:50:49.083652Z","title":"Longvila: Scaling long-context visual language models for long videos, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.02371","last_updated":"2026-06-29T16:52:45Z","snapshot_observed_at":"2026-08-11T00:23:10.170872Z","submitted_at":"2026-03-31T04:41:01Z","title":"Internalized Reasoning for Long-Context Visual Document Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T15:50:49.083652Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2604.02371"},"observation_digest":"sha256:8fae8c4cd623d2ae2e8b9ba8ac6b37ccd764085e8350aeaaeff6b6c422baabda","observation_id":"71bcfe3c-955f-4c7d-8ce3-230af1bdf7d3","resolution":{"observed_at":"2026-07-13T15:50:49.083652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2604.04372","last_updated":"2026-04-06T02:43:03Z","snapshot_observed_at":"2026-07-06T22:53:20.122451Z","submitted_at":"2026-04-06T02:43:03Z","title":"Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T19:46:16.975267Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2604.04372"},"observation_digest":"sha256:66de9821517fcf431e69d8ed838d74a3e561d4b75e59c0d2398ecb64eaa606b4","observation_id":"9f4e2245-1fdb-41a4-a997-73f0a05b38f7","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2604.08120","last_updated":"2026-04-09T11:40:25Z","snapshot_observed_at":"2026-08-12T15:49:45.453027Z","submitted_at":"2026-04-09T11:40:25Z","title":"Small Vision-Language Models are Smart Compressors for Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T18:38:49.654073Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2604.08120"},"observation_digest":"sha256:deb30b8682d2a45f4cba88f02155ab6af7a4c367ae2dad485cf4dff603fbdc94","observation_id":"ebdf246f-1770-4559-aedb-8b6979b1ba8a","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2604.14149","last_updated":"2026-04-16T15:48:38Z","snapshot_observed_at":"2026-08-11T17:29:29.888451Z","submitted_at":"2026-04-15T17:59:52Z","title":"One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T13:28:58.920442Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2604.14149"},"observation_digest":"sha256:5ab3362d0e1346cbce6746d6890a72002be518152482e94dcaf03503e35b3376","observation_id":"cd1c2ccc-c33b-4c39-87d2-0714eabfa0bc","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2604.17087","last_updated":"2026-04-18T17:52:02Z","snapshot_observed_at":"2026-08-11T04:01:39.120604Z","submitted_at":"2026-04-18T17:52:02Z","title":"EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T07:00:36.870817Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2604.17087"},"observation_digest":"sha256:f50cd2274824bec1841ff65cea22108cd52acc46f299653c89b092c6e1abe985","observation_id":"74a47e25-cc35-40a5-87bf-6e7caa239538","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2604.19564","last_updated":"2026-04-22T03:52:37Z","snapshot_observed_at":"2026-08-11T17:03:21.591027Z","submitted_at":"2026-04-21T15:15:02Z","title":"EgoSelf: From Memory to Personalized Egocentric Assistant","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T02:23:21.119521Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2604.19564"},"observation_digest":"sha256:ea9dda6cbc7f14d7a699c1e1ab6553f256ed45e5f9633f12f3658585e856f210","observation_id":"ccde0297-1dc5-463d-a8fe-859d7fd49494","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T01:30:19.531699Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:db2e240e5355b7440f82e523ed5e4c5ae4b4e0bbad692a6f9be3001130d8db49","observation_id":"bc06bbfb-44d3-42d0-82f5-508ddf1552ef","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:92ec05f0a805428a12ffc6717f01972d20f3bdd6bb4ccefa1ebef2cb303f56fa","observation_id":"046bbe7a-7f19-48b8-99b0-d3d23e3ab290","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2605.05848","last_updated":"2026-05-08T13:46:44Z","snapshot_observed_at":"2026-08-14T06:12:09.644545Z","submitted_at":"2026-05-07T08:23:27Z","title":"VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T14:48:39.444933Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.05848"},"observation_digest":"sha256:4aa251383079550875733e2bd5d0330f16128e4bd5b3afd8821a97d9c40e215b","observation_id":"be87e1d2-e415-4020-937e-7552ae94f7f5","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2605.05848","last_updated":"2026-05-08T13:46:44Z","snapshot_observed_at":"2026-08-14T06:12:09.644545Z","submitted_at":"2026-05-07T08:23:27Z","title":"VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T01:57:42.822121Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.05848"},"observation_digest":"sha256:6355f205ed86b2de74c1a466aa109dcc3ebc394fc3a6b224b68933dd651b2633","observation_id":"ab0367f3-5bfe-4ba2-9448-26f708c880c0","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2605.09223","last_updated":"2026-07-30T19:00:53Z","snapshot_observed_at":"2026-08-10T22:41:15.175214Z","submitted_at":"2026-05-09T23:47:46Z","title":"CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T03:06:09.753634Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.09223"},"observation_digest":"sha256:4a8cff19b3b1458dfd5e86b463f09d93ed04aa44b4824200f70a42de6afe9b06","observation_id":"1e989343-92d8-493f-8b4a-b669ce1a35b8","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2605.09223","last_updated":"2026-07-30T19:00:53Z","snapshot_observed_at":"2026-08-10T22:41:15.175214Z","submitted_at":"2026-05-09T23:47:46Z","title":"CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T22:47:19.742035Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.09223"},"observation_digest":"sha256:259e855e5692b56b95a94f3a3cb06ad55dc25cb610a1f9daee2f65219ae13bc9","observation_id":"029e2748-8498-4793-8a2a-405c3a0a1f05","resolution":{"observed_at":"2026-07-01T13:45:46.088920Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-03T00:18:46.366043Z","title":"Zhe Chen, Yizhou Wang, and 1 others","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.09223","last_updated":"2026-07-30T19:00:53Z","snapshot_observed_at":"2026-08-10T22:41:15.175214Z","submitted_at":"2026-05-09T23:47:46Z","title":"CREST: Curvature-Regulated Event-Centric Sampling for Efficient Long-Video Understanding","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T00:18:46.366043Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.09223"},"observation_digest":"sha256:162ab02c161c1caeaf2e9d304ef7f18cfb1d85f6831703e22ac840d4c41eab48","observation_id":"31788ae7-27eb-43cf-8cd2-821f2e3b9366","resolution":{"observed_at":"2026-08-03T00:18:46.366043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2605.13831","last_updated":"2026-05-13T17:52:53Z","snapshot_observed_at":"2026-08-14T01:10:15.805331Z","submitted_at":"2026-05-13T17:52:53Z","title":"Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T19:16:07.851098Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.13831"},"observation_digest":"sha256:dd13199186542ca8788b431ff8eab342daadd46757eedd62998fa7e70099da61","observation_id":"47a1b24b-8d8a-49dd-a613-dd3c3806ec66","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2605.22678","last_updated":"2026-05-21T16:20:31Z","snapshot_observed_at":"2026-08-01T16:56:58.243776Z","submitted_at":"2026-05-21T16:20:31Z","title":"Swift Sampling: Selecting Temporal Surprises via Taylor Series","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T05:55:23.479344Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.22678"},"observation_digest":"sha256:a1bdc900fb2fb33aa19cb48ad3b00e7df689d3ffeae6deb0cfa173a83880b7ac","observation_id":"c5c71c59-4de5-49d0-aa0b-a0df6e477d6c","resolution":{"observed_at":"2026-05-22T05:56:07.961469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2605.27318","last_updated":"2026-07-06T17:18:57Z","snapshot_observed_at":"2026-08-10T20:14:42.672269Z","submitted_at":"2026-05-26T17:26:29Z","title":"Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T18:15:28.261185Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.27318"},"observation_digest":"sha256:f76409db061e3e64607517cb5eb212a21bc2b2ac073c37e7f4d3a26f6eeb2cdd","observation_id":"07f73bc6-f0ff-44e6-ac0a-f94993f37b21","resolution":{"observed_at":"2026-06-29T18:23:50.945623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-12T15:54:12.909974Z","title":"LongVILA : Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27318","last_updated":"2026-07-06T17:18:57Z","snapshot_observed_at":"2026-08-10T20:14:42.672269Z","submitted_at":"2026-05-26T17:26:29Z","title":"Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-12T15:54:12.909974Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.27318"},"observation_digest":"sha256:1400f1e23533296ecf6dec80b58abd183b8e759cb16b3b31e356cc88ea27bf69","observation_id":"0130ce51-e65c-48b7-abb2-c525fe0a0439","resolution":{"observed_at":"2026-07-12T15:54:12.909974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2605.31069","last_updated":"2026-05-29T09:38:43Z","snapshot_observed_at":"2026-08-07T07:32:37.435310Z","submitted_at":"2026-05-29T09:38:43Z","title":"Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T23:16:42.001361Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.31069"},"observation_digest":"sha256:fc138486856942efe7634ccada231f13c773b2b6675dc91d63839013f71e98fc","observation_id":"b4f05b4b-83af-4181-bc86-8bef9461eabc","resolution":{"observed_at":"2026-06-29T00:02:50.363523Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2606.05748","last_updated":"2026-06-04T06:20:23Z","snapshot_observed_at":"2026-08-10T04:46:55.422655Z","submitted_at":"2026-06-04T06:20:23Z","title":"UNIVID: Unified Vision-Language Model for Video Moderation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-27T22:56:26.674841Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2606.05748"},"observation_digest":"sha256:249007598f75af796c6504eec568e213079c96cc214a1c8edc5b145fd6c4cbaa","observation_id":"8e6a09a3-8e35-4240-b24a-47ed9e3baea7","resolution":{"observed_at":"2026-07-02T16:07:09.203772Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2606.06532","last_updated":"2026-06-03T17:47:49Z","snapshot_observed_at":"2026-08-07T12:55:44.925060Z","submitted_at":"2026-06-03T17:47:49Z","title":"GOPAgen: Motion-Aware and Efficient Agentic Long-Video Understanding with Structural Memory and Hierarchical Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T06:33:32.090913Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2606.06532"},"observation_digest":"sha256:ca256f15827196cffad071c1a587c979e96d2ff683ce132a39d6acd2800976cc","observation_id":"bcd0124d-f8db-4577-b579-82827431bebb","resolution":{"observed_at":"2026-07-02T07:56:47.355750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2606.10401","last_updated":"2026-06-10T09:54:52Z","snapshot_observed_at":"2026-08-14T09:19:56.653594Z","submitted_at":"2026-06-09T04:20:08Z","title":"CoCoSI: Collaborative Cognitive Map Construction for Spatial Intelligence","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T14:17:08.713863Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2606.10401"},"observation_digest":"sha256:b6b5ca57daa9877c7276ecf1d4b6e749f92116aca087f41ae90fa73937f88cf4","observation_id":"e9005378-3d41-4bbf-8e38-b64a4b307b1e","resolution":{"observed_at":"2026-07-03T03:57:38.941419Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":250,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:979625eb7e2d488270a7f97004268c3a6dee7d5e7f6c5c9fa15a70dda82517fe","observation_id":"74c4334e-a3ac-4704-9e27-81e3771cb963","resolution":{"observed_at":"2026-07-03T10:48:02.937090Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2606.30288","last_updated":"2026-06-29T13:30:17Z","snapshot_observed_at":"2026-07-07T00:04:10.492340Z","submitted_at":"2026-06-29T13:30:17Z","title":"VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T06:01:49.904752Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2606.30288"},"observation_digest":"sha256:a9e95378353a3f627632e75f6dbb472bacf63d985ae8c24112127ac694ec8b0b","observation_id":"93d4162e-506b-402c-82c8-b3abd1f5afca","resolution":{"observed_at":"2026-06-30T06:04:21.232831Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2408.10188 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-12T20:40:40.836906Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:77de2b757214b1accd45c1406ecc447113552ce9bc651e1dedc633811683f133","observation_id":"e5a4a78c-c2e6-4cd1-b2a9-ad8f673a58f8","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-01T22:38:42.056803Z","title":"arXiv preprint arXiv:2408.10188 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.056803Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:f38abbd4a50168d57c8e218d2e2c05db99e62c3101c39b3e36351e7787c7058e","observation_id":"486bd35f-d07e-44b0-a4db-4a328a3b95d8","resolution":{"observed_at":"2026-08-01T22:38:42.056803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-01T21:09:42.330014Z","title":"LongVILA: Scaling long-context visual language models for long videos.arXiv preprint arXiv:2408.10188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16189","last_updated":"2026-07-17T17:59:27Z","snapshot_observed_at":"2026-08-08T05:22:33.805882Z","submitted_at":"2026-07-17T17:59:27Z","title":"Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T21:09:42.330014Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.16189"},"observation_digest":"sha256:d82133ecd3c2d434c2c5ca9155e7c71c529d5267d66426925ece5d602259734c","observation_id":"e31af0a0-7e39-488b-9e68-b986d5e74fa7","resolution":{"observed_at":"2026-08-01T21:09:42.330014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-01T09:09:24.840911Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20868","last_updated":"2026-07-23T02:49:24Z","snapshot_observed_at":"2026-08-14T02:15:50.697904Z","submitted_at":"2026-07-23T02:49:24Z","title":"ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T09:09:24.840911Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.20868"},"observation_digest":"sha256:983811a2329175b44d0f49d79fcc848329ffda1200d7618048d7d653b82887ee","observation_id":"8de799c9-32c9-4146-a16d-4d1b0ec32444","resolution":{"observed_at":"2026-08-01T09:09:24.840911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-01T07:12:17.649073Z","title":"arXiv preprint arXiv:2408.10188 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-13T09:55:09.197044Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.649073Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:85bf2c645611447cc8428e611baeb8ff42f68bf731327731d9781671167379c1","observation_id":"c4e6034e-a351-4ec5-a00d-a4b7e8a57876","resolution":{"observed_at":"2026-08-01T07:12:17.649073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-31T23:32:49.920089Z","title":"Longvila: Scaling long-context visual language models for long videos.arXiv preprint arXiv:2408.10188, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23951","last_updated":"2026-07-27T02:56:43Z","snapshot_observed_at":"2026-08-14T08:41:58.807029Z","submitted_at":"2026-07-27T02:56:43Z","title":"TimePLE: Rethinking Temporal Representation for Video Temporal Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T23:32:49.920089Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.23951"},"observation_digest":"sha256:2830e64cc5eb28c3ec7642e826ea3fcbd9a8debd693eb12189a5de33e431bd57","observation_id":"e611d802-01d6-4310-a637-78b7910859ed","resolution":{"observed_at":"2026-07-31T23:32:49.920089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-02T09:17:00.531111Z","title":"arXiv preprint arXiv:2408.10188 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24794","last_updated":"2026-06-30T10:55:56Z","snapshot_observed_at":"2026-08-14T09:16:45.162118Z","submitted_at":"2026-06-30T10:55:56Z","title":"Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:00.531111Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.24794"},"observation_digest":"sha256:4f20f6bd8fab8edb2231843c923769ca828c95a8a3500c453bdabd44682b0dd7","observation_id":"5a34c98e-320c-4300-afb0-5367261abcf7","resolution":{"observed_at":"2026-08-02T09:17:00.531111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-03T00:45:17.837663Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28678","last_updated":"2026-07-29T10:25:23Z","snapshot_observed_at":"2026-08-13T15:04:26.357335Z","submitted_at":"2026-07-29T10:25:23Z","title":"ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T00:45:17.837663Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.28678"},"observation_digest":"sha256:0522dbae5257f2424f7bbe01337ecb467cf0ca63254e1797db8e8d92c5332df7","observation_id":"dc18cbab-4a4b-40ed-a815-ea95be6e4c11","resolution":{"observed_at":"2026-08-03T00:45:17.837663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-04T23:46:51.611444Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-10T14:57:44.819541Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.611444Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:946f8a4e65ddcfa3744f5e60fc807333b0c500e6ce078e6ce48242c91b3f29fe","observation_id":"cec09a60-c794-45e3-8958-0ab05708261a","resolution":{"observed_at":"2026-08-04T23:46:51.611444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T23:42:35.091644Z","title":"arXiv preprint arXiv:2408.10188 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05780","last_updated":"2026-08-06T09:15:43Z","snapshot_observed_at":"2026-08-12T19:31:11.240092Z","submitted_at":"2026-08-06T09:15:43Z","title":"Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T23:42:35.091644Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2608.05780"},"observation_digest":"sha256:d4e3eabc84baadcd2408acfabaf65083d87903675b7084fa8d89e01a6086e17f","observation_id":"5a542cce-ab43-4480-b6da-baf3ac9d6403","resolution":{"observed_at":"2026-08-07T23:42:35.091644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.10188/citation-record","integrity":"/paper/2408.10188/integrity","json":"/paper/2408.10188/citation-record.json","paper":"/paper/2408.10188"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:02e18842c73dbf56bc0b2840aff9534237ba94fe776c56aa5567cdc7f2b521bd","observation_id":"cb1dc0fc-5209-47a9-9942-7ae5ee921114","resolution":{"observed_at":"2026-05-17T03:51:25.426441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:cfe763196e0fb994080f15fd4ae1bb146fd71858be97320bd645633a04fa58cd","observation_id":"56094f5c-d9cd-42fb-a593-1b42955fa160","resolution":{"observed_at":"2026-05-17T03:51:25.434788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:80dff92265add98d96965926ed35bfacc0d7569be52973c91bf5f0f2ed271215","observation_id":"54bf625c-a741-4d60-81c8-4c46b7298ba1","resolution":{"observed_at":"2026-05-17T03:51:25.440421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"f93ff324-f230-4a46-97b9-6b103c35585d","year":1901},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:25afc6f3ec42cf212db0ac35b7e8ed3f17c37132291905696eda96af571683bb","observation_id":"90b7ab22-bff7-4ed9-8eb9-7a162f75ebdc","resolution":{"observed_at":"2026-05-17T03:51:25.562568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-12T23:48:30.486852Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:ea0117c2e293981e328d7560f0b86c2b2d8f29e6b33ca6f8743d9078a833eee0","observation_id":"37de3bd8-d552-455b-8ae0-d85ac3b9b3dd","resolution":{"observed_at":"2026-05-17T03:51:25.468836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":"2404.16821","doi":"10.48550/arxiv.2404.16821","metadata_source":"pith","pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","venue":"cs.CV","work_id":"3714835e-c5a6-4d7e-950c-be44670ed9e6","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:fc6fa580cac843132af11e5a433ff559dde0b8d9d5182fde1e77db28966eef19","observation_id":"32defd73-02ed-41fe-8e63-0400eeb118d8","resolution":{"observed_at":"2026-05-17T03:51:25.473222Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2305.06500","doi":"10.48550/arxiv.2305.06500","metadata_source":"pith","pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","venue":"cs.CV","work_id":"f3aac728-ded0-4e55-aa9e-4a1635d4313d","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:2cacf5e737a6d81ed3c6ce5c10e2c53dc6e8d3ee3d7b27ba00e6e848d6015e41","observation_id":"53a3aed6-ce6c-4011-99c0-46e83767ebd5","resolution":{"observed_at":"2026-05-17T03:51:25.477865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T01:53:48.691056Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:893e3a9b29eeb2fd7edbd6676111d33d0d68d058c1684e3383a59f478c8b69d0","observation_id":"ea921a89-baf1-462c-9244-d255d3a4832d","resolution":{"observed_at":"2026-05-17T03:51:25.482472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14129","last_updated":"2024-06-20T09:14:19Z","snapshot_observed_at":"2026-08-12T23:38:35.030300Z","submitted_at":"2024-06-20T09:14:19Z","title":"Towards Event-oriented Long Video Understanding","version":1},"cited_work":{"arxiv_id":"2406.14129","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14129","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards event-oriented long video under- standing","venue":null,"work_id":"2a4d2abc-3821-4d51-b7fd-dea04af30014","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2406.14129","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:e3ca4101fb13e1db52d354ac98c16b90e175cc0c0075095511e0eb7d2cb088f7","observation_id":"d6ac9486-1e28-4040-97af-101056ef9f39","resolution":{"observed_at":"2026-05-17T03:51:25.487005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-08-13T21:15:18.571730Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":"2405.07719","doi":"10.48550/arxiv.2405.07719","metadata_source":"pith","pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A unified sequence parallelism approach for long context generative ai","venue":"cs.LG","work_id":"277d0fdf-d9cc-4497-ad08-04aba6226c36","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:d3cd0d200e8779ef5095c874d94c5b440fa0aba66c8f7358e5400f895aa2b6b6","observation_id":"a9abefde-f27c-4d42-99c0-da002f77df0a","resolution":{"observed_at":"2026-05-17T03:51:25.491822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17453","last_updated":"2024-10-31T23:23:22Z","snapshot_observed_at":"2026-08-12T23:15:28.135270Z","submitted_at":"2024-07-24T17:37:05Z","title":"VILA$^2$: VILA Augmented VILA","version":2},"cited_work":{"arxiv_id":"2407.17453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.17453","snapshot_observed_at":"2026-07-02T11:46:55.437498Z","title":"VILA2: VILA Augmented VILA","venue":null,"work_id":"cda20748-41d3-4441-bd08-7b1038d3a0c0","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2407.17453","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:34217996710514f9c513dc6ce7e906c8fafe2669680657956894b418f12e7c08","observation_id":"f2405f20-9ccc-4d71-a894-2529394534bd","resolution":{"observed_at":"2026-05-17T03:51:25.496419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-12T22:57:40.927684Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":"2408.14023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-07-04T09:39:46.765108Z","title":"Video-ccam: Enhancing video-language understanding with causal cross-attention masks for short and long videos","venue":null,"work_id":"2ed72cbe-f6a7-4149-911f-be5ff9cb6d0e","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:f01500e9f1ed50bc246c1c1bca9ad540c6fcb0932f5e3fc7dbc1d3f10c853a99","observation_id":"8ce1ff7b-9ec1-483c-9524-5056486179ab","resolution":{"observed_at":"2026-05-17T03:51:25.501093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:e4afbdc3ae0f5dc8862871ab28a3c4a6684dece843ac7b2fa23d01e309363234","observation_id":"9cbf8cc3-7eff-4bb4-9520-b3411ddf9d44","resolution":{"observed_at":"2026-05-17T03:51:25.506156Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-13T05:15:07.522678Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:929ecfb29b4380ff98610ca058f1c3043990484d4cd526191d5c61beb9762353","observation_id":"170e0518-604d-4cd6-a103-28c2ad1cb0fb","resolution":{"observed_at":"2026-05-17T03:51:25.511626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-13T22:49:56.824755Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":"2309.14509","doi":"10.48550/arxiv.2309.14509","metadata_source":"pith","pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","venue":"cs.LG","work_id":"bb119d0b-c7f0-412a-a426-f74bd6949a51","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:37ac0ac9203efb4e099b111f43e55b9f8eab49dea18381c953b7f17fce8b26f4","observation_id":"46e5f56b-e178-4905-841f-e22a74343bf8","resolution":{"observed_at":"2026-05-17T03:51:25.516837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08046","last_updated":"2024-04-05T15:21:09Z","snapshot_observed_at":"2026-08-13T05:25:45.984864Z","submitted_at":"2023-11-14T10:11:36Z","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding","version":3},"cited_work":{"arxiv_id":"2311.08046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08046","snapshot_observed_at":"2026-07-02T16:07:09.229084Z","title":"Chat-univi: Unified vi- sual representation empowers large language models with image and video understanding","venue":null,"work_id":"4702aaae-3849-4e6b-9d23-b744d2f31d03","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2311.08046","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:bcda505f7e60b0af9253be478a11b8cf48fb37ca1e67959270e422f925b5e1e3","observation_id":"b1216bd9-e3ee-4891-9ce7-10f6d56fc121","resolution":{"observed_at":"2026-05-17T03:51:25.521450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13649","last_updated":"2024-06-06T02:01:09Z","snapshot_observed_at":"2026-08-05T16:01:54.847394Z","submitted_at":"2024-01-24T18:35:21Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","version":2},"cited_work":{"arxiv_id":"2401.13649","doi":"10.48550/arxiv.2401.13649","metadata_source":"pith","pith_arxiv_id":"2401.13649","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","venue":"cs.LG","work_id":"37f08c56-1b7d-4d9e-baf9-7c2ebb7e6acd","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2401.13649","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:276ff950d150145303fee6494b6d74d1f52782f40c2ef6fc390b06e302327ead","observation_id":"80893e8c-77c4-44cb-bc06-d1d12a13a3b0","resolution":{"observed_at":"2026-05-17T15:20:36.653799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":"2006.16668","doi":"10.48550/arxiv.2006.16668","metadata_source":"pith","pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","venue":"cs.CL","work_id":"52b3c9a6-2a27-45a7-ba2b-ebe4b5bb5a5f","year":2020},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:333ada9f3be52fb382518aebcd94b8f4f8fc159aee88040108005fe5f2fa6e9f","observation_id":"fa92da15-b858-46b0-976a-a1aa3a29e093","resolution":{"observed_at":"2026-05-17T03:51:25.529874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:c695494fd756da767fa9060015df5e25598f3fde8b1c09bb2dcf91bc6b53bcbe","observation_id":"2680417b-f22a-4d16-9b97-a82fac67b69f","resolution":{"observed_at":"2026-05-17T03:51:25.534046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":"2311.10122","doi":"10.48550/arxiv.2311.10122","metadata_source":"pith","pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","venue":"cs.CV","work_id":"e2121c51-a55e-476a-af81-7ba6970fe6cf","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:f310beff5ec2b943620ae6e1441410b02d2d5daa5ec9f85ff9794144fff36c5c","observation_id":"7f547896-5c53-4ada-a1a9-90af91d4c2f1","resolution":{"observed_at":"2026-05-17T03:51:25.538073Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:8de494c1c5838166e6817f364a452572bb78c51f89fd65967a6265d24ba8c74d","observation_id":"5154cb12-06db-403b-9760-a7a14a26b185","resolution":{"observed_at":"2026-05-17T03:51:25.542171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:c004a7e6a6b0f07b7555e65d49e1b68bf5aeac539b47e70dbb7c2e4d3ab17fdc","observation_id":"871aeb76-d8d1-44a5-bdfc-d6499bad7856","resolution":{"observed_at":"2026-05-17T03:51:25.546496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-14T03:33:46.294739Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:3d435b8b386293e35c21f6b93d2bfedd30f0255702797f6433993bdafa68a796","observation_id":"d3b4c877-6572-4ee1-9d34-78eaa540acc5","resolution":{"observed_at":"2026-05-17T03:51:25.550887Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.263809+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.263809+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:f7306ac6aa5c1054da2ef06049bb550cc448087f73d0275c02513e306ef3b36b","observation_id":"765286f6-65f9-4b05-abc7-e4e392fbc8c1","resolution":{"observed_at":"2026-05-17T03:51:25.554718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03384","last_updated":"2024-07-20T07:17:00Z","snapshot_observed_at":"2026-08-13T00:37:48.294859Z","submitted_at":"2024-04-04T11:33:29Z","title":"LongVLM: Efficient Long Video Understanding via Large Language Models","version":3},"cited_work":{"arxiv_id":"2404.03384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03384","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longvlm: Efficient long video un- derstanding via large language models","venue":null,"work_id":"7de0baf4-b523-45a8-8908-29260c0ed9dd","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2404.03384","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:8b4207e20f83dfe29ee9176736a19375e9d6bfc27749a457df1ea611007c1516","observation_id":"d0e5c6bd-88f0-4615-8af4-d2bfd8d928f9","resolution":{"observed_at":"2026-05-17T03:51:25.559116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":"2407.15754","doi":"10.48550/arxiv.2407.15754","metadata_source":"pith","pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","venue":"cs.CV","work_id":"f6bb6dd9-35f5-4788-9063-af4d76699147","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:7824b29d95fc6e72d6da99145f38a88f61eb8fe01f153dd77c8f874ab67aede9","observation_id":"8f25afe6-c526-4608-ba71-a17de0a9feac","resolution":{"observed_at":"2026-05-18T00:30:12.519784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":"2404.16994","doi":"10.48550/arxiv.2404.16994","metadata_source":"pith","pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","venue":"cs.CV","work_id":"8949d4db-20f2-47c1-83a6-fcbe041b62ef","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:283bd9bb4a8b76c2d76d3a44000bad67b72af86b489edd511ecdba73c529df59","observation_id":"13225eb0-71a5-49ab-a703-09f0e60b2f0d","resolution":{"observed_at":"2026-05-17T03:51:25.452760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19335","last_updated":"2024-05-29T17:59:58Z","snapshot_observed_at":"2026-08-12T23:54:54.762113Z","submitted_at":"2024-05-29T17:59:58Z","title":"X-VILA: Cross-Modality Alignment for Large Language Model","version":1},"cited_work":{"arxiv_id":"2405.19335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-VILA: cross-modality alignment for large language model","venue":null,"work_id":"dafe02b3-76e1-4cea-a443-5a34bf5ee0c4","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2405.19335","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:e14826f3ffa8d71e28de3522bcde96ccb797430bbe50da6cc32e90dd433f7349","observation_id":"a786d3c0-69ef-421c-8c9f-00faf4e84fca","resolution":{"observed_at":"2026-05-17T03:51:25.458475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-13T01:15:12.087659Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":"2406.08085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-07-04T20:00:08.182505Z","title":"Flash-vstream: Memory-based real-time understanding for long video streams","venue":null,"work_id":"f53e5fea-3444-480b-aa38-be98378c0ced","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:fe750b7e2b3cbe18d0e4f84a918d436fec3f41cb4bc3bf047bb7e3da6b9239e4","observation_id":"16ce91fa-49dc-4fb9-85aa-a081ec43c810","resolution":{"observed_at":"2026-05-17T03:51:25.463933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cb5701a7-c6b0-40bc-a569-cc9287ce50ce","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:940b16c691253b4f6c22c4f589c68e6bfa9688fec6c88b0b71af48e4bf3fb878","observation_id":"8bd723d1-b7bb-4e9a-b7fd-adcf22ab438a","resolution":{"observed_at":"2026-05-17T03:51:25.568554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specifically, the average scores rise from 2.00 to 3.26, highlighting the model’s enhanced capability in generating accurate and rich captions with more frames","venue":null,"work_id":"b96341c3-b981-4c6b-a498-db5d384c0b0d","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:c1af1f112f87f8bde4213158cd54e8df8e8b58d7189411315d72c4e156a727d9","observation_id":"346a20b5-cf8a-4d4b-9201-da914dea3e20","resolution":{"observed_at":"2026-05-17T03:51:25.571713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We found that FSDP offers more efficient memory management, which led us to select it as our default configuration","venue":null,"work_id":"b72c30b0-4f38-4487-a9e7-d8fd3ada1a42","year":2020},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:320e4aa7e5a5f24a357ef7c00b3b7c87879e9e06c7e38d2d63c6bc4666ec4b5d","observation_id":"3d3d13dd-38ff-4899-8d5f-5dd411117d62","resolution":{"observed_at":"2026-05-17T03:51:25.565650Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","latest_version":6,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":25,"verified_fuzzy":2},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 87 inbound Pith citation observations for arXiv:2408.10188."}