{"as_of":"2026-08-08T01:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:671fb980483f63dba6b88f4d429aff810bb474f37b2bc0218d82284d4c2debdd","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:08:11.296096Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20100/citation-record","integrity":"/paper/2505.20100/integrity","json":"/paper/2505.20100/citation-record.json","paper":"/paper/2505.20100"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:12.251791Z","title":null,"venue":null,"work_id":"813d9436-a29e-4c66-874a-fc0164d9bf35","year":2022},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:07.334198Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:2de97e676c2ccfb91418ab95d8885f7a2c2d09baea23fe3282a65035c07470ec","observation_id":"71c38705-e07d-4bc7-b2ac-ffdc02face53","resolution":{"observed_at":"2026-08-07T14:08:12.301984Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:07.469918Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:07.469918Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:bb264251c35e5419405c905f4f255308014d4f3fce59a31fbc52340e688ec53d","observation_id":"2632c7f6-f7db-4558-b5f4-5fa871d22dc3","resolution":{"observed_at":"2026-08-07T14:08:07.469918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:08:07.651269Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:07.651269Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:ae20db559b2309af99efc235abcda62773f92652e3caf228673c2abe8e34e39b","observation_id":"bc8321d9-4ebe-4ec6-9b16-5f6864a728b2","resolution":{"observed_at":"2026-08-07T14:08:07.651269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T14:08:07.824929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:07.824929Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:64072a4a12e31287e3e104318410647a6c84c0e5940d731f7563b92ea11df414","observation_id":"6254fc63-920a-4b5f-87a6-2df08e1a02d5","resolution":{"observed_at":"2026-08-07T14:08:07.824929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:08:07.940796Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:07.940796Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:006e04fc75c1aabfba4b5d68a201ab1396d5507867cb2dc697f8410ad6b7000d","observation_id":"b0622fd0-cdb1-4abe-8054-84a79293f9f5","resolution":{"observed_at":"2026-08-07T14:08:07.940796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:08.008568Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.008568Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:423cbb0d588c22b6323c299d504801c5fd2c9944f16552bd13e9ef5b1af7da36","observation_id":"f923c722-715d-4bfb-9910-bc41f5fbb8fd","resolution":{"observed_at":"2026-08-07T14:08:08.008568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-03T03:15:29.208149Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-07T14:08:08.089865Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.089865Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:3f6e52fa9283d9faa84f2582e8db9eee3df561ba011083d95eba9ce78e4e8361","observation_id":"534f4d18-7d34-49ee-85ae-c58f6212dcc6","resolution":{"observed_at":"2026-08-07T14:08:08.089865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T14:08:08.176479Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.176479Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:9e9e9d5b5f5ec26911e3a813a38a7a6513ca4fb49ac04f663ddad61f4764abd9","observation_id":"a8546b57-4fee-4192-901d-55c9b19b1f6d","resolution":{"observed_at":"2026-08-07T14:08:08.176479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:08.244315Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.244315Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:f6a233e8bc9cf50b67ab5e1533df537bd52883b08badd41ff18d67da0cfe6e78","observation_id":"1c896fc2-dcc5-492d-9fb8-479e882bc975","resolution":{"observed_at":"2026-08-07T14:08:08.244315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:08.362280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.362280Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:13a76ec2812c7dd9efd518a1fb826a475bc76402567144cd600e478a549f987f","observation_id":"a6e6a82e-f71a-4c19-8fb0-484b227b7c9b","resolution":{"observed_at":"2026-08-07T14:08:08.362280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:08.441927Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.441927Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:b0e091e6dd8525417a9e8d5c2752d68c16421b5f3fd8fd8fd64ebbfeed2dbb07","observation_id":"6d01685b-994d-4601-b622-0ab88a9f2b8f","resolution":{"observed_at":"2026-08-07T14:08:08.441927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-07T14:08:08.604098Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.604098Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:70490cde0fe610daf30b23f8e23d1bab4a023313bd8f145012eab02537d35f5c","observation_id":"6a74b289-d8f6-4edf-8326-1d43112a9d3a","resolution":{"observed_at":"2026-08-07T14:08:08.604098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03860","last_updated":"2021-10-11T15:17:21Z","snapshot_observed_at":"2026-07-06T11:55:39.142653Z","submitted_at":"2021-10-08T02:22:50Z","title":"Token Pooling in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03860","snapshot_observed_at":"2026-08-07T14:08:08.722595Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.722595Z"},"links":{"cited_paper":"/paper/2110.03860","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:6e5b7fa6bcc3b4ebd24b1bb078ac71028c9cf2a19d35033cd29f5a9420b9d02f","observation_id":"5881e8b5-c92a-453e-9282-cec7857fda4a","resolution":{"observed_at":"2026-08-07T14:08:08.722595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:08.812415Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.812415Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:b6d80d25dcd5f16cd7bd49d9be9122dae6c1683efd96867bb3c4ea5b62da1ac2","observation_id":"28b71577-081d-48db-9b00-002d3184eb0e","resolution":{"observed_at":"2026-08-07T14:08:08.812415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:08.931794Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:08.931794Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:98f8af06fdbc89b0484d988b73fa52e72e1f248fec0272f0e8d41f57e6414cf1","observation_id":"60050535-e83c-40ad-860c-0162b6037cca","resolution":{"observed_at":"2026-08-07T14:08:08.931794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:09.028514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.028514Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:6b7da961576ab49647bb7c4c6b12efc8bd846b5a7334058f3313c98247e94713","observation_id":"7efea8a8-b5aa-4968-98cd-7a1618d18b7e","resolution":{"observed_at":"2026-08-07T14:08:09.028514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:09.144568Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.144568Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:c82c1aff304fad48d611e1eb0d8956af2eefec7929bb10e1949d6a82c2e8abbd","observation_id":"e5a98b9c-3fd7-4452-be25-fa03219ee3e9","resolution":{"observed_at":"2026-08-07T14:08:09.144568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-08-07T14:08:09.248749Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.248749Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:2f5e452e5632cf68d1cc37791bf66e00a44ecec0b3122f09aa86eb212757d92e","observation_id":"52f69615-1a5e-44bc-b7fc-b0b73babfd78","resolution":{"observed_at":"2026-08-07T14:08:09.248749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11205","last_updated":"2025-03-14T08:49:52Z","snapshot_observed_at":"2026-08-07T17:04:36.345651Z","submitted_at":"2025-03-14T08:49:52Z","title":"LLaVA-MLB: Mitigating and Leveraging Attention Bias for Training-Free Video LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11205","snapshot_observed_at":"2026-08-07T14:08:09.356278Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.356278Z"},"links":{"cited_paper":"/paper/2503.11205","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:3748f10f73490599b5624465a7e63bc712d3fb313fe335be7e66754e56874d78","observation_id":"719b3a36-7538-4b16-8b26-79d5f3e9e793","resolution":{"observed_at":"2026-08-07T14:08:09.356278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-05T13:11:54.824513Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-08-07T14:08:09.432264Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.432264Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:e489781f93bd0a008bf10a8e4ad4a47e031ca6953c44558fa3104e595b0748a1","observation_id":"3f1acf08-3f3e-4d4d-bf9c-889c2570e0ce","resolution":{"observed_at":"2026-08-07T14:08:09.432264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:08:09.546942Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.546942Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:47453a5f681c936816ac9dec531023c4d496cd8347e4aa1cac92d9c575c501e0","observation_id":"b65dbd14-f6a8-49b6-92c7-ec607346748e","resolution":{"observed_at":"2026-08-07T14:08:09.546942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-03T19:45:14.759418Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05819","snapshot_observed_at":"2026-08-07T14:08:09.626063Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.626063Z"},"links":{"cited_paper":"/paper/2412.05819","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:d0c01e0994d0dd1d6fc84440737270a05ce1a9837af807248bb7b6132fed15eb","observation_id":"0684c49d-fb94-46a0-b763-5b078f39c65b","resolution":{"observed_at":"2026-08-07T14:08:09.626063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:08:09.721510Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.721510Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:0b77c7d67bf3c895dd8d1a189bea59ca7b044e996dafb5411239d217b3536566","observation_id":"4599b744-4add-46b6-865e-7532ca33d6c2","resolution":{"observed_at":"2026-08-07T14:08:09.721510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:09.823977Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.823977Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:cf51717598fb1e71d0ef959cdfe1d5304f6c8cd65fc842b741b54edad827ca1f","observation_id":"4f7f90ef-383e-4577-a8fd-68578ae97ab5","resolution":{"observed_at":"2026-08-07T14:08:09.823977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T14:08:09.942396Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:09.942396Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:097bde8d43a4beb72f1bfbeacb0d68b4d381713b4ac7f7e883934465a1c915b0","observation_id":"6a2b4522-d97e-4cef-9d57-7819ff5ce560","resolution":{"observed_at":"2026-08-07T14:08:09.942396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-07T14:08:10.024398Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.024398Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:ec817872b2b5f8ac8fee5f26dd10913e15f715af225616d92fec47b232fcd702","observation_id":"309b5d2b-9e37-4f24-ba44-7ec66d766431","resolution":{"observed_at":"2026-08-07T14:08:10.024398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T14:08:10.098876Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.098876Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:3c6b5763ecfc2b8f19efdd6de4ccc1d0aebba86075ea71f789d5cd56026aa01e","observation_id":"f8ea79b2-886a-4b30-b6aa-f3be6fafe4b8","resolution":{"observed_at":"2026-08-07T14:08:10.098876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:10.209360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.209360Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:baed800f557d2f024ff92d886a401e7fb0054a7100b537474d5f1c736a1c4a0a","observation_id":"e9e59250-5ad6-411f-8c5c-3c558679a56d","resolution":{"observed_at":"2026-08-07T14:08:10.209360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:12.008840Z","title":null,"venue":null,"work_id":"06c1537b-1e55-4650-a7c6-5db88f69f5a7","year":2022},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.294540Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:ba6f4db46f40498b53c8fff433c0774d2481a1d7e95cbb121399c2a9f71bcb4e","observation_id":"997ad8eb-01d5-4ffc-9546-4130bccf413a","resolution":{"observed_at":"2026-08-07T14:08:12.075391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:10.384993Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.384993Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:a473dc252f2cea56d2c88e412ac7a50beb197578d2c01e03f3ca1349e5ab8e7d","observation_id":"1ebabf5a-c74d-4111-a3a1-8db4a9fb5a18","resolution":{"observed_at":"2026-08-07T14:08:10.384993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T14:08:10.490334Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.490334Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:c7f83664054e5dae9f1ba6697348d9d352d357ef16bf87326b33bcadb68c2901","observation_id":"94ea1965-e3a7-4fd4-9eec-5b6d1d628f21","resolution":{"observed_at":"2026-08-07T14:08:10.490334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-08T00:45:04.947316Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-07T14:08:10.568820Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.568820Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:f23f67f36990433389ba06842e675a7379aee1ba55a3b2f6f12c739b448a6b4b","observation_id":"a152e2cf-71b3-4838-ae5a-24f22fbedff1","resolution":{"observed_at":"2026-08-07T14:08:10.568820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T14:08:10.697724Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.697724Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:2de617d540d1e8e22298361bcc84d5d65b5f007b16ff204b052d5953070faa84","observation_id":"f3a496cd-ad53-4c95-84c7-41cd139ded15","resolution":{"observed_at":"2026-08-07T14:08:10.697724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:10.807603Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.807603Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:13e5df63de8555ff39fecb15d1b07df7eadb8fe4fd936809333790fa24cc9ea6","observation_id":"68ab79c8-9c58-4478-a77d-c559245a1bea","resolution":{"observed_at":"2026-08-07T14:08:10.807603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03248","last_updated":"2025-07-29T08:19:36Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T11:47:57Z","title":"AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03248","snapshot_observed_at":"2026-08-07T14:08:10.915558Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.915558Z"},"links":{"cited_paper":"/paper/2412.03248","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:d5c08276da16fb6a63151f8474827cbb48a573855ae610a0b808e09d8e9b90b6","observation_id":"4ed619fe-2182-414b-afff-bd1a1ca8dd69","resolution":{"observed_at":"2026-08-07T14:08:10.915558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T14:08:11.015163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:11.015163Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:c09e0ac45bfe9456e09a9c1674a41533355ba1cf84586074988e79b5e278b132","observation_id":"952ba7ea-fada-4dde-9e84-ad50a5522652","resolution":{"observed_at":"2026-08-07T14:08:11.015163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:08:11.091612Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:11.091612Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:b5076be4c1c6c2204b45a0078a5230e3b2e551ba5da569807ca49a4b8b64a727","observation_id":"6010160f-7766-4bbb-8aaf-153c129cd9cc","resolution":{"observed_at":"2026-08-07T14:08:11.091612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:11.196238Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:11.196238Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:2efc349630d47c49421e6723ea5215a899f0dadecb61172d0157ab34dbe8ceb2","observation_id":"8786fdcd-26d9-4adf-934a-6e0d31b5786c","resolution":{"observed_at":"2026-08-07T14:08:11.196238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:08:11.296096Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:11.296096Z"},"links":{"citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:0c497db9217dfcc24d616919551b2ee493bf0359dfb33f1b4b0464079fdb2f7f","observation_id":"af24ddb6-0af2-402c-9f88-22bada028561","resolution":{"observed_at":"2026-08-07T14:08:11.296096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:45:52.342992Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2505.20100."}