{"as_of":"2026-08-07T16:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e662d5973cc1d1f4434526496b14cde4162ee5e97be15a6b29d4b5617bc6ad8f","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:15:05.248695Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T18:39:24.915547Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:09:57.149192Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":"2506.22139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-04T16:09:57.149192Z","title":"Q-frame: Query-aware frame selection and multi-resolution adaptation for video-llms","venue":null,"work_id":"2b209583-6ef6-4e41-96ea-7ec74820dd14","year":2025},"citing_paper":{"arxiv_id":"2604.08077","last_updated":"2026-04-09T10:48:32Z","snapshot_observed_at":"2026-07-06T22:57:13.745326Z","submitted_at":"2026-04-09T10:48:32Z","title":"AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:47.439019Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2604.08077"},"observation_digest":"sha256:ee12286d97b5cedfa487affa733204713387a3934043289216cde2adb56dc607","observation_id":"0b6ad907-50e4-4dc3-bfa1-ecd47740152c","resolution":{"observed_at":"2026-05-11T06:56:04.269758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-12T15:34:37.002001Z","title":"Q-Frame: Query- aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T15:34:37.002001Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:a247887827269cb66f3c4abe11bc0ed7c72012cef2b4c81f6788e0dae8de9d6a","observation_id":"33844b79-8431-4eda-bdce-8ca1e28b38dc","resolution":{"observed_at":"2026-07-12T15:34:37.002001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-14T18:39:24.915547Z","title":"Q-Frame: Query- aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31027","last_updated":"2026-07-11T04:14:11Z","snapshot_observed_at":"2026-08-02T10:01:28.608360Z","submitted_at":"2026-05-29T08:58:39Z","title":"Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T18:39:24.915547Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2605.31027"},"observation_digest":"sha256:b5d1489c8da725b0a542f801549d39db1694f70ef97b3c8733c58a77eaed0ee2","observation_id":"eacdb4a2-0578-4ee1-87d6-3cc48c57148e","resolution":{"observed_at":"2026-07-14T18:39:24.915547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":"2506.22139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-04T16:09:57.149192Z","title":"Q-frame: Query-aware frame selection and multi-resolution adaptation for video-llms","venue":null,"work_id":"2b209583-6ef6-4e41-96ea-7ec74820dd14","year":2025},"citing_paper":{"arxiv_id":"2605.31029","last_updated":"2026-05-29T09:01:56Z","snapshot_observed_at":"2026-07-06T23:40:12.939143Z","submitted_at":"2026-05-29T09:01:56Z","title":"PEEK: Picking Essential frames via Efficient Knowledge distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T22:46:53.704892Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2605.31029"},"observation_digest":"sha256:82147940ff64ef6353bdc46dd925f381cac926de3c2461da712ffa00a22a69c0","observation_id":"079f6c34-65d1-42bd-aab7-82261c6a427e","resolution":{"observed_at":"2026-07-01T19:16:01.318490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":"2506.22139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-04T16:09:57.149192Z","title":"Q-frame: Query-aware frame selection and multi-resolution adaptation for video-llms","venue":null,"work_id":"2b209583-6ef6-4e41-96ea-7ec74820dd14","year":2025},"citing_paper":{"arxiv_id":"2606.03100","last_updated":"2026-06-04T05:13:15Z","snapshot_observed_at":"2026-08-01T16:37:35.015535Z","submitted_at":"2026-06-02T03:38:51Z","title":"Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T10:54:02.188634Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2606.03100"},"observation_digest":"sha256:202f00a22361da053d7fd46049e1b1166dce9c361e1aa66ff938e728d5400da4","observation_id":"9498d452-63c8-44f2-8693-0f8a72695bb3","resolution":{"observed_at":"2026-07-02T02:26:27.027565Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":"2506.22139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-04T16:09:57.149192Z","title":"Q-frame: Query-aware frame selection and multi-resolution adaptation for video-llms","venue":null,"work_id":"2b209583-6ef6-4e41-96ea-7ec74820dd14","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:542fd1db11556139fd32d39c319b6f420fced450b493a8823f27e900d8e4db3d","observation_id":"de4ae604-e237-4b7a-9565-2c18234cc729","resolution":{"observed_at":"2026-07-02T17:27:15.057718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":"2506.22139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-04T16:09:57.149192Z","title":"Q-frame: Query-aware frame selection and multi-resolution adaptation for video-llms","venue":null,"work_id":"2b209583-6ef6-4e41-96ea-7ec74820dd14","year":2025},"citing_paper":{"arxiv_id":"2606.24187","last_updated":"2026-06-24T04:06:43Z","snapshot_observed_at":"2026-08-05T05:31:09.631074Z","submitted_at":"2026-06-23T06:13:30Z","title":"Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T00:53:43.629684Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2606.24187"},"observation_digest":"sha256:1333d50b0238f84d621043630c37a8a387ddda8a2ff61aa2c87e8481c6ca4ee8","observation_id":"9824f3dc-f80b-4c09-b06c-904f35ade8c6","resolution":{"observed_at":"2026-07-04T16:09:57.150830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"cited_work":{"arxiv_id":"2506.22139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22139","snapshot_observed_at":"2026-07-04T16:09:57.149192Z","title":"Q-frame: Query-aware frame selection and multi-resolution adaptation for video-llms","venue":null,"work_id":"2b209583-6ef6-4e41-96ea-7ec74820dd14","year":2025},"citing_paper":{"arxiv_id":"2607.00983","last_updated":"2026-07-01T14:19:24Z","snapshot_observed_at":"2026-08-07T14:23:12.463890Z","submitted_at":"2026-07-01T14:19:24Z","title":"QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-02T14:09:54.549499Z"},"links":{"cited_paper":"/paper/2506.22139","citing_paper":"/paper/2607.00983"},"observation_digest":"sha256:32b68b49a314f4e9f215a9536cc31315bc7a15210ac82911bf8d6e7f71aa797c","observation_id":"5051ba87-dc57-4d7a-946d-cbf469c36426","resolution":{"observed_at":"2026-07-02T14:17:02.668832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22139/citation-record","integrity":"/paper/2506.22139/integrity","json":"/paper/2506.22139/citation-record.json","paper":"/paper/2506.22139"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T22:15:01.915030Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:01.915030Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:2e3731f20d755b462257846eae318137133419ef036d29068bc25feaa4ec3343","observation_id":"a2c548b6-25d1-44d2-ac91-7ec88012bc3a","resolution":{"observed_at":"2026-08-06T22:15:01.915030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.965440Z","title":"Robust motion-guided frame sam- pler with interpretive evaluation for video action recognition","venue":null,"work_id":"e2879679-1bf2-4399-bd2a-4eb2afcf2aa7","year":2025},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:01.967902Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:65118394a7525e3e44b352496279327f2199155d1337c6b1207d5d9a8a1fb162","observation_id":"ea63bb34-9624-424a-a837-d4b9cafa0642","resolution":{"observed_at":"2026-08-06T22:15:09.053397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.798623Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"f163a7dd-5d8d-4426-8e61-edcc02b2ffc6","year":2025},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.033532Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:540e83ffd22706b1ee9cedb6be1fb52752748954e6cc99f59f9e8e52c3b9ec44","observation_id":"86249126-8260-4bac-8d4e-d5b7523ba862","resolution":{"observed_at":"2026-08-06T22:15:08.884299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:02.128356Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.128356Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:e37f3194842c5b665c9d7b856ff2cc5b77256add8f4093f2de2157ceb0f09847","observation_id":"5ca6dea2-4ce0-4342-9bda-680746d4e6d6","resolution":{"observed_at":"2026-08-06T22:15:02.128356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T22:15:02.241212Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.241212Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:43cabe4324596bae024cb65c3dd315a5eaf32cdcff3062c7dfe6f7386d3b9685","observation_id":"636f60ca-4311-4df5-bf28-12d428f28cbd","resolution":{"observed_at":"2026-08-06T22:15:02.241212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-06T22:15:02.340057Z","title":"Video-ccam: Enhancing video-language un- derstanding with causal cross-attention masks for short and long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.340057Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:9966026075b5f1499d6ea5e6f69471aca0f8d26fee7881b9b2b2cf2705c8cb81","observation_id":"55a5ff53-44d3-4273-8475-82950400326c","resolution":{"observed_at":"2026-08-06T22:15:02.340057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T22:15:02.450017Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.450017Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:2c931f2af6bf08c0ed1afac3408345415549143e8aaf3e657a57aa5c90532ba5","observation_id":"260f516a-eb60-4a70-aa94-5a542647b211","resolution":{"observed_at":"2026-08-06T22:15:02.450017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-01T18:34:23.156273Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-06T22:15:02.527447Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.527447Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:0858aae0940d711b318deec6e9a024779804096c152cb386e291976879869b85","observation_id":"d7ed91ed-796f-4940-b039-802d573b9f48","resolution":{"observed_at":"2026-08-06T22:15:02.527447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.624654Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video un- derstanding","venue":null,"work_id":"f3e55776-50ff-4ac4-b3a9-47679d94666a","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.615899Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:30b2207fde704028ee001c830259b23fb10afb81e68461049d25e8c1c73b89bb","observation_id":"e1403065-aac9-4fcd-bfdc-403074e446ef","resolution":{"observed_at":"2026-08-06T22:15:08.677569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T22:15:02.714570Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.714570Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:6b870ed8ffb02d8e93dfd6a996a0deac5f2f873791b3675cb1e3f5dede957ad4","observation_id":"49eacf54-21f3-4a01-b6c3-b164f5b11144","resolution":{"observed_at":"2026-08-06T22:15:02.714570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.474794Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"7004325b-cabf-4a1e-ac64-9d4478530793","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.778441Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:e34e35419810c0ac75df3ef1197c0c79406bc9729629f7ebfc6155dbae0deb78","observation_id":"f53e097e-80e5-4101-b645-9a7a49a929b7","resolution":{"observed_at":"2026-08-06T22:15:08.537709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.296883Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"f63b6505-0b73-4549-9b5e-1bb40e6bbd17","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.859142Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:255f4714d4cc4ba2041d796ce513d1549ac9df2c6faf3849c0c03df2ac9ee787","observation_id":"a797c863-8993-4d59-b303-c2213ace2331","resolution":{"observed_at":"2026-08-06T22:15:08.389761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03104","last_updated":"2024-08-10T14:57:37Z","snapshot_observed_at":"2026-07-06T18:40:57.362549Z","submitted_at":"2024-07-03T13:41:44Z","title":"KeyVideoLLM: Towards Large-scale Video Keyframe Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03104","snapshot_observed_at":"2026-08-06T22:15:02.922173Z","title":"Keyvideollm: Towards large-scale video keyframe selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.922173Z"},"links":{"cited_paper":"/paper/2407.03104","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:ae3d0c6a2d69b0f3e9eb2750587cfd3ad1e72c53af1883b5408b6ecb59099581","observation_id":"76dc95d8-f7e4-4b88-9a02-94e10a7c9b77","resolution":{"observed_at":"2026-08-06T22:15:02.922173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:08.138072Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":"278f6778-963e-44f5-b03d-27a073cc8b2d","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:02.991356Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:65c0f007dbda27ecac8f456661ed46ebc75090951ba9a5150a5f951d145556f4","observation_id":"b2dd8b82-c552-47d0-885a-c4f771f400d5","resolution":{"observed_at":"2026-08-06T22:15:08.243146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:07.973229Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"bf1f83b9-bdf1-4947-9ddf-5e21d531237f","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.062699Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:27bfe55beda1bada9cadeb689c119e152e721b2333679f3a5692b087c5a6f433","observation_id":"2475e21a-6cd2-4261-8e08-9faca5ee815c","resolution":{"observed_at":"2026-08-06T22:15:08.048504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:07.769990Z","title":"Visual instruction tuning","venue":null,"work_id":"85f3a0d6-2abb-4f6e-9214-44de1e24ea07","year":2023},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.144052Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:13fc685127a762c7a0865455d202d820b109092a454987770e205a70c177a966","observation_id":"d5d2932f-6139-47ee-8d33-e1b0201e24e6","resolution":{"observed_at":"2026-08-06T22:15:07.838909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:03.202524Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.202524Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:069d3751c41c43add2dde297d96351f538c5f051dae369a1272c018ffa409968","observation_id":"73badf97-5289-4ab2-9a12-ae2e30d2d29d","resolution":{"observed_at":"2026-08-06T22:15:03.202524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:07.605928Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"4199969d-9805-4ddc-8393-91c1bb4e6734","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.286726Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:75b71262da29c03c889bfc06dd3050d17466e08e654e7d72cdc392acda61f2a1","observation_id":"b8379fdf-f320-447c-9623-29220e3249d2","resolution":{"observed_at":"2026-08-06T22:15:07.653968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-07-06T19:06:54.428910Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-06T22:15:03.351183Z","title":"Kangaroo: A powerful video-language model supporting long-context video input","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.351183Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:4a437cf645a20083cb68b3c4243890da0f4409b546a1972aad01d0b23f9a5b2a","observation_id":"0f33d806-78f9-4ccf-9bd3-34caa259491c","resolution":{"observed_at":"2026-08-06T22:15:03.351183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:07.410693Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"2a09f979-504a-4b39-b124-de9e9ef11b32","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.417538Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:6abfaff513c7bd710047215e9965997ed5ad72006fe80cbd4544cfa6e97d3fc7","observation_id":"666db4a5-e386-4eac-b8a7-5681a16d0392","resolution":{"observed_at":"2026-08-06T22:15:07.490542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:07.193360Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":"3d55bf2a-28ef-497f-8f43-3cf7d0d5b48f","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.481220Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:d7f8c55c2a1ffef93bdfc71cde9538b6ebbe320ca722939b120b81638435cce5","observation_id":"ad62d436-89cf-4000-b98e-3e65e6ed29ca","resolution":{"observed_at":"2026-08-06T22:15:07.287773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.992602Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"2c9566a5-047f-4e77-a089-90ea63b4c2fc","year":2021},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.561078Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:7b8224b21da19555314cfe07438556c18372c79df43e2e0c530c2c0413c28757","observation_id":"9fbe48c4-ba7c-415b-a164-a6f7af190310","resolution":{"observed_at":"2026-08-06T22:15:07.110497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.853397Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"2b76967e-9fc7-4a57-b7ba-e838227b376e","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.678869Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:e293a0086b43e80272ef54cf69990414a5f378716e65acb72540e7eea21bac23","observation_id":"20018ddc-e8da-4d12-8dd6-b41804ca24cd","resolution":{"observed_at":"2026-08-06T22:15:06.906491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T22:15:03.755141Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.755141Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:168038c62d30b8936bfd1cf0eacf87d7546cc8d3e649bd795a65cf69591bfb89","observation_id":"51b1b8f9-be18-4d35-bc41-a649916768d0","resolution":{"observed_at":"2026-08-06T22:15:03.755141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:03.824422Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.824422Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:f7c8333e5997e4b787590a7fa22f076dd48b30c82997b2097384cc5b7235e51a","observation_id":"5f3b6777-e92f-4325-91a5-bf8b25fc6660","resolution":{"observed_at":"2026-08-06T22:15:03.824422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:03.875000Z","title":"Video understanding with large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.875000Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:76b15141a170e78d04940e46dbb67fd3a5760e3e94429b315c069a156c63f381","observation_id":"b47ab2da-1955-449d-998b-88df156c4469","resolution":{"observed_at":"2026-08-06T22:15:03.875000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T22:15:03.971684Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:03.971684Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:a7624a9f4be9d3cd9c3f4c2875458d2205659c61ba8376dec479990847bdb8c9","observation_id":"e4359f59-bc8b-46fe-a718-628a619f961b","resolution":{"observed_at":"2026-08-06T22:15:03.971684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.691657Z","title":"Internvideo2: Scaling foundation models for multi- modal video understanding","venue":null,"work_id":"a4196953-0091-47c5-9ebf-4181b421a7e1","year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.029772Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:a202275dc863fc55a0074d9a5b1cbd4a91caaac7d06df657922f23575bdc4458","observation_id":"1f4c3484-0531-472f-ad6f-3aa4f348d22f","resolution":{"observed_at":"2026-08-06T22:15:06.755357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.578505Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"f4d7db9e-d349-4d3a-87bc-44106e7d8d0c","year":2025},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.102916Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:322d0d45bc485a1ff6c2464f8ae90f0f5e22d464a08375ce0e080b4e32873b08","observation_id":"e39c4189-926f-46bb-b906-7f1542fec27a","resolution":{"observed_at":"2026-08-06T22:15:06.629724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.453402Z","title":"Multi-agent reinforcement learning based frame sampling for effective untrimmed video recognition","venue":null,"work_id":"8a0768a3-7dc1-45d2-ad76-364fdad842df","year":2019},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.241569Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:e5a1b8e260f2bb37f43f13b738507fd5cb19d379fccaffc26a5e124687f44bab","observation_id":"e73ebea1-c1cf-4f09-8858-be514963c3a3","resolution":{"observed_at":"2026-08-06T22:15:06.502690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.326929Z","title":"Adaframe: Adaptive frame selection for fast video recognition","venue":null,"work_id":"6f50bc81-b8a5-4747-8d60-e11454955894","year":2019},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.299593Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:b59e7e82bb50b8be65817d0877d27f61ab5168bad0dedaa908a9317e314100a5","observation_id":"d916726f-0327-4842-ae41-4fcc2571c33c","resolution":{"observed_at":"2026-08-06T22:15:06.387469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-06T22:15:04.382683Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.382683Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:0557c26a21079597a7a0c7655a13c543e3a867774e7ee5cee0dd2f8755e8f81f","observation_id":"a4b2f519-101d-44cc-af46-640da2b1c2df","resolution":{"observed_at":"2026-08-06T22:15:04.382683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.217018Z","title":"Frame-voyager: Learning to query frames for video large language models","venue":null,"work_id":"e08d9ccf-dbc3-4e5c-9ef5-a2d7cf710493","year":2025},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.480606Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:2deb3a4ec397c4d27732e645a26ba1b8667fae14afae83f704870c470edf9659","observation_id":"665bd746-852e-4a8b-a786-607ecfbe37a9","resolution":{"observed_at":"2026-08-06T22:15:06.261410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:06.079929Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"7a2c3c35-463c-49e6-82e3-c572776f60ad","year":2023},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.561512Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:631719e7f107e7f8e60bbf7c8d7dcc3028a1a3234a30cf31599a66d001ed55c0","observation_id":"eb4d00fa-9cc6-44eb-bf77-de94c0c3682b","resolution":{"observed_at":"2026-08-06T22:15:06.143689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T22:15:04.623326Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.623326Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:ec5e05b611f73c4433959e9008680ab083e9abac8da31debfe3e2871a8710f27","observation_id":"e0e680ee-9a99-4961-857a-fd21ac5307dd","resolution":{"observed_at":"2026-08-06T22:15:04.623326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T22:15:04.686714Z","title":"Lmms-eval: Re- ality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.686714Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:094d5f56c25bcd5d60eb399c7f305a633507b89b5738b1e9fd8a69d39993bae9","observation_id":"5d985fbf-4b73-481f-b255-2b737e68829e","resolution":{"observed_at":"2026-08-06T22:15:04.686714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T22:15:04.749344Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.749344Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:407db9b63b22867b1b1a53c90e58258f6d5ae99d59eae26f2af70efa051dc8d3","observation_id":"ef8de3d9-0280-4974-bb2f-47853121def6","resolution":{"observed_at":"2026-08-06T22:15:04.749344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-07-06T17:54:03.923842Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-06T22:15:04.864133Z","title":"Direct preference optimiza- tion of video large multimodal models from language model reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.864133Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:c9abedf12a65065cb8514307ad78959b60ff3b27f447ba9581229f7f89a8a618","observation_id":"5a1f0d10-f715-47c1-b335-f47ffddde9c3","resolution":{"observed_at":"2026-08-06T22:15:04.864133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T22:15:05.019965Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:05.019965Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:8c06ea99e2c85f4fb031aa0cd68130175430465da06d829b197423e7032d626a","observation_id":"0c307f2e-7cdd-4c08-b992-c4fc22cea03a","resolution":{"observed_at":"2026-08-06T22:15:05.019965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:05.935086Z","title":"Mgsampler: An explainable sampling strategy for video ac- tion recognition","venue":null,"work_id":"ba711317-cb48-4d1c-92a0-cfb0e62fdba3","year":null},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:05.086874Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:d75bcee117eaf1391e4f87d99951ecd17f9b930f033b5fe1e5fbe58ff1d59006","observation_id":"9fc18216-6abf-4dc7-915d-f115ba96b59f","resolution":{"observed_at":"2026-08-06T22:15:05.983536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-06T22:15:05.172214Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:05.172214Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:1dbe2bf5827481b85b9c24401b52563a12561a716086529a5ced1d4803b23605","observation_id":"f71645bf-2cfe-46ad-8924-4ae73dd3d962","resolution":{"observed_at":"2026-08-06T22:15:05.172214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:15:05.795588Z","title":"Limitations Q-Frame enhances query-aware video understanding, but it depends on pre-trained models, lacks explicit temporal modeling, and operates within a fixed token budget","venue":null,"work_id":"61c01e1e-4315-4205-9ca5-d2eb68c4e976","year":2023},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:05.248695Z"},"links":{"citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:edee3989fa8d349f5a235f37546ad7143ae122f7450357f39c0e5891b9f08cc1","observation_id":"2eef322c-e13d-4329-90c3-8916f65c57a9","resolution":{"observed_at":"2026-08-06T22:15:05.867099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:07:43.493361Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 8 inbound Pith citation observations for arXiv:2506.22139."}