{"as_of":"2026-08-09T14:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69aef4fd0c1083e77d960d184104f59512d065178353cce6cb54eb1db9868caf","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T22:38:47.340935Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15689/citation-record","integrity":"/paper/2607.15689/integrity","json":"/paper/2607.15689/citation-record.json","paper":"/paper/2607.15689"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:41.660878Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:41.660878Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:f29492e77fafe026255a81e1d83594702739764f7e899d63a0e8d52456c69165","observation_id":"e9d699af-873a-4b22-b63d-7e2243652ff4","resolution":{"observed_at":"2026-08-01T22:38:41.660878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:41.714721Z","title":"Proceedings of the 2024 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:41.714721Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:1c627eb3e3871a114bae1686b2378397661932630a943f314d6994d202feb0ad","observation_id":"d126ce7d-31e6-4b21-8589-6d1ffbc98e4f","resolution":{"observed_at":"2026-08-01T22:38:41.714721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:41.772008Z","title":"Science China Information Sciences , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:41.772008Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:03147db8d5508012e5cd1378158d07eac3a1bfe5ae7037c9d4e19d6c50f4d4e7","observation_id":"dbf9d22f-f5b7-4b34-8c67-4acc3f614be7","resolution":{"observed_at":"2026-08-01T22:38:41.772008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-01T22:38:41.828170Z","title":"arXiv preprint arXiv:2406.07476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:41.828170Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:e18dca177a4af11f43c60c0ba4b644c05a0a620ef1f8023f079fd9db5fa10b96","observation_id":"982faadf-2023-46fc-aba7-c4cd54575a44","resolution":{"observed_at":"2026-08-01T22:38:41.828170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:41.887011Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:41.887011Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:e11c9dd597568e23cf21e7628c0bb5875ee30356577ed61be1e6da2006a44244","observation_id":"7e6805ad-acac-40b5-9cfb-2befdf91bfa4","resolution":{"observed_at":"2026-08-01T22:38:41.887011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-01T22:38:41.936578Z","title":"arXiv preprint arXiv:2408.03326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:41.936578Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:fc10af1ad2dcadea2b7193bc992b0e982476ea3206d6bc4fde57d51e125b0fb0","observation_id":"3f1fa2b7-8292-45f3-96a8-fe26957e6842","resolution":{"observed_at":"2026-08-01T22:38:41.936578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-08T03:13:28.000968Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-01T22:38:42.003198Z","title":"arXiv preprint arXiv:2407.15841 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.003198Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:7b2a0feecec6cff9d2981aa93f161c4d10573cdd337922665df9ac2ce6517c1f","observation_id":"16129752-a127-47ff-a819-6c64e0f6fe8d","resolution":{"observed_at":"2026-08-01T22:38:42.003198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-01T22:38:42.056803Z","title":"arXiv preprint arXiv:2408.10188 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.056803Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:f38abbd4a50168d57c8e218d2e2c05db99e62c3101c39b3e36351e7787c7058e","observation_id":"486bd35f-d07e-44b0-a4db-4a328a3b95d8","resolution":{"observed_at":"2026-08-01T22:38:42.056803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:42.121515Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.121515Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:e33c207f2c56030cfa8c872dfa2496d6eb69b01647fb4d234f4368cef621124e","observation_id":"43fe9119-866d-48ab-a661-8e100b2f6cc4","resolution":{"observed_at":"2026-08-01T22:38:42.121515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-01T22:38:42.181503Z","title":"arXiv preprint arXiv:2408.14023 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.181503Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:d5fb7e114822f4d365669b724b71674b6fde0cbe02e98e4ecac7d1e684ff0ba4","observation_id":"2bbef040-3c0b-47ca-98da-46922382d900","resolution":{"observed_at":"2026-08-01T22:38:42.181503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-01T22:38:42.230180Z","title":"arXiv preprint arXiv:2410.17434 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.230180Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:ecf87458cd5788e5a304be036ae3b493554f657f7e835926d7a3a21800d0281b","observation_id":"35115adc-2044-40d7-869a-d71058c4bde1","resolution":{"observed_at":"2026-08-01T22:38:42.230180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02438","last_updated":"2025-09-10T04:22:46Z","snapshot_observed_at":"2026-08-07T16:12:02.851576Z","submitted_at":"2025-04-03T09:55:09Z","title":"Scaling Video-Language Models to 10K Frames via Hierarchical Differential Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02438","snapshot_observed_at":"2026-08-01T22:38:42.291857Z","title":"arXiv preprint arXiv:2504.02438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.291857Z"},"links":{"cited_paper":"/paper/2504.02438","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:aa2f8b1376788f71c9db1ec878cc4b4e592eb753abddf2f92b2d029bb44d83c0","observation_id":"9d159b4b-e366-4cc5-8ef7-38491711865f","resolution":{"observed_at":"2026-08-01T22:38:42.291857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-06T20:37:19.866170Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01949","snapshot_observed_at":"2026-08-01T22:38:42.344173Z","title":"arXiv preprint arXiv:2507.01949 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.344173Z"},"links":{"cited_paper":"/paper/2507.01949","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:4b7269f45c2440fc05256c56474514a51f03163e782d6635e9b1e0408048399f","observation_id":"b75f4b92-3907-478c-bcfe-b74fa1f47dc4","resolution":{"observed_at":"2026-08-01T22:38:42.344173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:42.502073Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.502073Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:150dbfc6af9c2f539387d9cefbbcbd5ef5a628815128dfe5e5b8dd3f13625d2f","observation_id":"551218d4-c04f-439e-a53f-3bfd87281b30","resolution":{"observed_at":"2026-08-01T22:38:42.502073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-08T15:25:00.286848Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06428","snapshot_observed_at":"2026-08-01T22:38:42.688411Z","title":"arXiv preprint arXiv:2502.06428 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.688411Z"},"links":{"cited_paper":"/paper/2502.06428","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:9f6d5a1c96a39b306aec223e491a7b33e2d6c64dab29d2772368cfdb85e9c7c2","observation_id":"023e1e81-9023-4cee-9360-1e5ca636e1a5","resolution":{"observed_at":"2026-08-01T22:38:42.688411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:42.912377Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:42.912377Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:d6d96c72a22896751125686747cd3369a31adb9087d32445f3cc49df89031cb9","observation_id":"542ba471-83a9-47ca-a073-4a16e8c2cb39","resolution":{"observed_at":"2026-08-01T22:38:42.912377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:43.040367Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:43.040367Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:6b20b243515d19288242c9464a55813a0e83d1649b23c42829b7223c5109f8e1","observation_id":"a6bc7367-482b-473f-8b13-5e7a81be1241","resolution":{"observed_at":"2026-08-01T22:38:43.040367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:43.147436Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:43.147436Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:f30745358a6be57446fe18e374f90bc839a6fa2a3a9d7964d65fd3a87eb75768","observation_id":"9c78edad-fd1b-42a5-8d4e-8cf73009e44f","resolution":{"observed_at":"2026-08-01T22:38:43.147436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:43.203874Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:43.203874Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:2f2234bb3b6ecb371fc8396c4828fa96fe0bea652bd6f440cfaeebdc36263190","observation_id":"a7eae351-3594-405c-b82e-254fb07595ec","resolution":{"observed_at":"2026-08-01T22:38:43.203874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03226","last_updated":"2025-03-28T03:19:52Z","snapshot_observed_at":"2026-07-06T19:27:33.934338Z","submitted_at":"2024-10-04T08:26:06Z","title":"Frame-Voyager: Learning to Query Frames for Video Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03226","snapshot_observed_at":"2026-08-01T22:38:43.297703Z","title":"arXiv preprint arXiv:2410.03226 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:43.297703Z"},"links":{"cited_paper":"/paper/2410.03226","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:3f5d56fead98257b8d81ff9b29598dcef8eb10509cd6058a0bebffd03c966292","observation_id":"732a5076-6ed2-4016-b11f-da781c3c7154","resolution":{"observed_at":"2026-08-01T22:38:43.297703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-09T00:23:31.907645Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15447","snapshot_observed_at":"2026-08-01T22:38:43.510039Z","title":"arXiv preprint arXiv:2505.15447 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:43.510039Z"},"links":{"cited_paper":"/paper/2505.15447","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:15cfb378009538b74920c78c6e341075c9e9c65f25b0d81b172fcb6d08cced77","observation_id":"3638ec97-6a7f-47c4-81fd-d04f151aeebf","resolution":{"observed_at":"2026-08-01T22:38:43.510039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:43.617246Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:43.617246Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:2539b2b7c148e83f80631c0807ed502f2a15bd654e508138a5ae4d4ba6c85bc7","observation_id":"0b37c1b7-b82d-47ba-88ac-a0f415b44d24","resolution":{"observed_at":"2026-08-01T22:38:43.617246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:43.732788Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:43.732788Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:966d281d98f0b620c3488956e129614d7951020cfba2f9a98d8c140299f27119","observation_id":"7ab06932-f2dc-42a1-9b7e-ec6315e31dcd","resolution":{"observed_at":"2026-08-01T22:38:43.732788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:43.902744Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:43.902744Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:c39d29be93adc3284faf11a030a76b7dcbe6dd4071e0821910a7d5539218bfa7","observation_id":"74d5455b-21e8-4602-a0c4-edff0915cd0e","resolution":{"observed_at":"2026-08-01T22:38:43.902744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00318","last_updated":"2026-04-04T04:38:43Z","snapshot_observed_at":"2026-07-06T21:34:05.672636Z","submitted_at":"2025-05-31T00:08:21Z","title":"Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00318","snapshot_observed_at":"2026-08-01T22:38:44.131300Z","title":"arXiv preprint arXiv:2506.00318 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:44.131300Z"},"links":{"cited_paper":"/paper/2506.00318","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:b017e9246f38e1bc65e268c5b66d26602e54087003b4478cf39eefb315e81ce1","observation_id":"c6a5feda-df2f-4f5c-a1a4-34270efe751c","resolution":{"observed_at":"2026-08-01T22:38:44.131300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:44.225953Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:44.225953Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:5d029a8ff3082e4dc153b470d4a28c662f357de7d666539a36c93522da814847","observation_id":"ae03ae1c-57e0-4df6-9099-5ea9281c1d45","resolution":{"observed_at":"2026-08-01T22:38:44.225953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:44.340870Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:44.340870Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:c06f56936fd60a10db09d57c9f3ac3432ce51f1a35489ba6d8a98a0f8f6480e0","observation_id":"14407740-561b-4ab0-8e05-8d21b0a16b86","resolution":{"observed_at":"2026-08-01T22:38:44.340870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:44.445751Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:44.445751Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:019d7fa9ce78e749cb86866d82548fcaec4048bf3cdf9e7f640f1bb2acf915b6","observation_id":"ab762f98-691a-4e91-a1f8-b064bbe9fa96","resolution":{"observed_at":"2026-08-01T22:38:44.445751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-01T22:38:44.609118Z","title":"arXiv preprint arXiv:2502.14786 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:44.609118Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:9975731165cd831558909e4cfdb61300d51c250f1f87c24b5d5c463b4ec38de8","observation_id":"dabbd4ca-4291-44c8-952c-7d0454feb6e8","resolution":{"observed_at":"2026-08-01T22:38:44.609118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:44.752176Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:44.752176Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:aa1fc25ac2f14c1f170499f103bbf0cde942da4e95662e4878124ff9e37b1810","observation_id":"be02a39a-0481-468d-848e-ec29f764cd70","resolution":{"observed_at":"2026-08-01T22:38:44.752176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:44.896998Z","title":"LMMs-Eval: Accelerating the Development of Large Multimodal Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:44.896998Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:77465ed4a088709fb1dfc5b355a44207d3cfaf3545a3c33b041f8a2cd48b3097","observation_id":"c998c41b-a74a-43d2-bfa7-8b7ac441124c","resolution":{"observed_at":"2026-08-01T22:38:44.896998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:45.017110Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:45.017110Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:de7d6b1c5377cae0e483f18606d517a6b4cd2fec73629e7ecc80832666748aad","observation_id":"2856f8eb-a084-4664-befd-5bb1241ca836","resolution":{"observed_at":"2026-08-01T22:38:45.017110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T22:38:45.121056Z","title":"5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:45.121056Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:4e739f21df3d0dfc7a4874065ebd5464643694537c8374c098a28358568ac197","observation_id":"1a5f4efb-2082-46bb-b31e-168becc202de","resolution":{"observed_at":"2026-08-01T22:38:45.121056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:45.217906Z","title":"2024 , howpublished =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:45.217906Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:ec4d8e87f2e78dfcb420fc5875c09fdbc9f973bef8f40d481ca6692e983324d8","observation_id":"5baadcdd-3acb-44b1-8c0e-f4ff8be78c9a","resolution":{"observed_at":"2026-08-01T22:38:45.217906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:45.297149Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:45.297149Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:c2b48ca14efa713b25f7767f181907f5fc260fd9801bd43e34e6c6b09f2ed6f8","observation_id":"ea9794b4-b136-4d67-baa3-cbc6469ab891","resolution":{"observed_at":"2026-08-01T22:38:45.297149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T22:38:45.400837Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:45.400837Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:9af47833e4a1922e6fc953f1ddf2fbefbdc3b0d74451f58e90a4170b3995fdf5","observation_id":"a2a12512-a6fd-4b8b-a593-cec6c9014f1a","resolution":{"observed_at":"2026-08-01T22:38:45.400837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:45.508334Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:45.508334Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:1b28126c4701e2dff8c827ac7d148fa81c5f39d19bdb55ba63abdd7becdfe758","observation_id":"39f26be3-53e9-4c38-b469-70f7db0bff8e","resolution":{"observed_at":"2026-08-01T22:38:45.508334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:45.657730Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:45.657730Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:591c426dbea69823b1e36be4fffa909307d8a6ee0cc828589c9b58a6cf829c9b","observation_id":"cbe4b01c-be6e-410f-b62f-cbb0ef346cb9","resolution":{"observed_at":"2026-08-01T22:38:45.657730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-01T22:38:45.828964Z","title":"arXiv preprint arXiv:2410.02713 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:45.828964Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:54e96e50014abd89e4828395d23e61710a2ba1b5aa4c9b57ed2af23d3000799b","observation_id":"59620e5e-8656-4920-9a29-6bd6d3c46d32","resolution":{"observed_at":"2026-08-01T22:38:45.828964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-01T22:38:45.986561Z","title":"arXiv preprint arXiv:2409.12191 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:45.986561Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:59d17cfc52052befbca19d2f10b1e59595379ea46868db8f2904a0fd0480c5ea","observation_id":"d014b4e7-dd97-4ca6-bfba-9d026d61ca29","resolution":{"observed_at":"2026-08-01T22:38:45.986561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:46.096044Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:46.096044Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:3f94e9c8f25ee256cee67184ac2c3849f23beecbb62021918435819fbc735f6a","observation_id":"be6c229a-dfb1-47e4-84a9-823ea7d0fc5e","resolution":{"observed_at":"2026-08-01T22:38:46.096044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14515","last_updated":"2024-10-30T13:38:10Z","snapshot_observed_at":"2026-07-06T18:34:24.078145Z","submitted_at":"2024-06-20T17:26:01Z","title":"MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14515","snapshot_observed_at":"2026-08-01T22:38:46.251209Z","title":"arXiv preprint arXiv:2406.14515 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:46.251209Z"},"links":{"cited_paper":"/paper/2406.14515","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:1f2101a8e9d8098349c6e13c74b659336ef03bf4ab16b2aad4d7f8edc0151c03","observation_id":"08fc3bc3-eab0-45af-a13f-60e86cd4ff4e","resolution":{"observed_at":"2026-08-01T22:38:46.251209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-01T22:38:46.380037Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:46.380037Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:0e7644fcfab48a551caa899460924df45859b87adc33ea5d2bb5bed192b67c79","observation_id":"8df1a760-9674-46c4-886d-16f17f13170c","resolution":{"observed_at":"2026-08-01T22:38:46.380037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-01T22:38:46.520050Z","title":"arXiv preprint arXiv:2410.21276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:46.520050Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:e741f479eabcd85bd225ea570fdddc70fe4159eb0b1dd7972702e2e2ceef7b13","observation_id":"3f3101e5-e3c1-4138-9464-d00e20841585","resolution":{"observed_at":"2026-08-01T22:38:46.520050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-01T22:38:46.621136Z","title":"arXiv preprint arXiv:2403.05530 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:46.621136Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:4e2d31d4287e9474b56baf176136586b317217c1cb78c7237c24148b89ca5382","observation_id":"0f599655-59fa-4af4-b30c-c0633ce361cb","resolution":{"observed_at":"2026-08-01T22:38:46.621136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:46.718466Z","title":"2023 , url=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:46.718466Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:72f745e1dc4411254b7daf361b0864f3fdbc338ba55d2cf96e90465f09d9f46e","observation_id":"3e637cc5-662e-4c33-b1d2-0dc4bb11fce2","resolution":{"observed_at":"2026-08-01T22:38:46.718466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:46.867016Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:46.867016Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:cb7c913100307b47ffec6a8026c06afa813f67422698ea1142ab0bb0361e9538","observation_id":"50af191e-c0fd-4646-8cfa-999ad45eab79","resolution":{"observed_at":"2026-08-01T22:38:46.867016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:46.980296Z","title":"2510.04428 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:46.980296Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:d3cbfd040626d8ef57d0b25ed2800afb0b09402f999fb6cbd756fd6e056ee9e4","observation_id":"d5b3bf85-6798-4be6-81e1-ee9a3bbccaae","resolution":{"observed_at":"2026-08-01T22:38:46.980296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:47.110495Z","title":"2603.25072 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:47.110495Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:2c6b27c48d5c1821d325628ee4b7062caaac9cf6c1fb85b8aac7a1ff6080f8cd","observation_id":"6130b671-47c6-47e8-bfee-7e53335fd434","resolution":{"observed_at":"2026-08-01T22:38:47.110495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T22:38:47.224513Z","title":"2602.22932 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:47.224513Z"},"links":{"citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:e8030cd15a4c93675cfc63bd6b9dc77b571043e5410ace80c6223d17e17ccb6a","observation_id":"dae80eb8-8c3e-46e5-82af-631ce4a86c8b","resolution":{"observed_at":"2026-08-01T22:38:47.224513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T22:38:47.340935Z","title":"arXiv preprint arXiv:2303.08774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T22:38:47.340935Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.15689"},"observation_digest":"sha256:06cdfd0296b890953601037191fc75b7d75e6dc47cb5df7668ad5cdc211102fe","observation_id":"0029752c-f2c1-4cd8-bb54-ae641cb0010e","resolution":{"observed_at":"2026-08-01T22:38:47.340935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15689","last_updated":"2026-07-17T07:04:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:22:15.675454Z","submitted_at":"2026-07-17T07:04:31Z","title":"Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2607.15689."}