{"as_of":"2026-08-07T19:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f77c33890410c643d51835050abe9dee52caae1e6b58560d07b28bbcdbca15ec","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:32:53.658205Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T06:57:28.323422Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-07T12:32:53.658205Z","title":"xgen-mm-vid (blip-3- video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-07T12:22:55.467747Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:53.658205Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:20d03b8e6d8446c706c11acc756ab2782cf666fcd04a1bca980b3adc537d268d","observation_id":"dae1cfa4-b820-47e8-a865-124eaad7325d","resolution":{"observed_at":"2026-08-07T12:32:53.658205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-07T10:56:05.354802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-07T10:47:31.423763Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.354802Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:a3c55c3be60b0fd5f29f2b965646d774b9797391ae122369d748d72bc92cd4ab","observation_id":"53677ca5-1ac8-42b3-9335-e3510cf0ee6d","resolution":{"observed_at":"2026-08-07T10:56:05.354802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-06T18:32:48.415433Z","title":"xgen-mm-vid (blip-3- video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-07T11:51:55.851858Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:48.415433Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:9c4236b97b98ac52d410ebf3b1b0163482389bde63bea31897a5a4463ea8a41e","observation_id":"83a72fcd-4822-4217-91f4-a59a1769c279","resolution":{"observed_at":"2026-08-06T18:32:48.415433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-05T10:58:17.487286Z","title":"xgen-mm-vid (blip-3-video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03501","last_updated":"2025-09-03T17:33:20Z","snapshot_observed_at":"2026-08-07T14:11:47.550063Z","submitted_at":"2025-09-03T17:33:20Z","title":"Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T10:58:17.487286Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2509.03501"},"observation_digest":"sha256:32a4a6a89e8194ec61336d364195c67ea4240fd6fe9853d612b3a2aaa45a3e97","observation_id":"2f9abcff-b849-49cd-b4bc-18e75325fbd6","resolution":{"observed_at":"2026-08-05T10:58:17.487286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":"2410.16267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"xgen-mm-vid (blip-3-video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":"6279ca83-fe69-421f-8f40-4fdbb92af441","year":2024},"citing_paper":{"arxiv_id":"2605.07568","last_updated":"2026-05-08T10:40:08Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T10:40:08Z","title":"Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T03:04:27.841522Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2605.07568"},"observation_digest":"sha256:0feb3e5c90a5c73f569703e08b83a2624245d241bce3e35af8508adf4f0478f2","observation_id":"ac4e92f5-44c9-4494-bc87-5a20e2f7b837","resolution":{"observed_at":"2026-05-11T03:05:53.165996Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":"2410.16267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"xgen-mm-vid (blip-3-video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":"6279ca83-fe69-421f-8f40-4fdbb92af441","year":2024},"citing_paper":{"arxiv_id":"2605.09904","last_updated":"2026-05-12T03:09:23Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:47:59Z","title":"TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T04:13:21.487431Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2605.09904"},"observation_digest":"sha256:8853125cf49a68cf05f5e88a39cca407f49a3b7927232ea8f10030f7642ab4ff","observation_id":"ed9d0d5d-9b5a-4980-a5e6-040ceb006084","resolution":{"observed_at":"2026-05-12T06:31:26.761795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":"2410.16267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"xgen-mm-vid (blip-3-video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":"6279ca83-fe69-421f-8f40-4fdbb92af441","year":2024},"citing_paper":{"arxiv_id":"2605.09904","last_updated":"2026-05-12T03:09:23Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:47:59Z","title":"TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T06:53:42.726350Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2605.09904"},"observation_digest":"sha256:99c445284352686e2bac44793ad8ecb1ec923db4b0135aedb2a16dfd873f3163","observation_id":"57b75438-a683-4f00-af2d-872cc0916474","resolution":{"observed_at":"2026-05-13T06:57:28.326463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-01T21:09:44.272531Z","title":"Ryoo, Honglu Zhou, Shrikant Kendre, Can Qin, Le Xue, Manli Shu, Jongwoo Park, Kanchana Ranasinghe, Silvio Savarese, Ran Xu, Caiming Xiong, and Juan Carlos Niebles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16189","last_updated":"2026-07-17T17:59:27Z","snapshot_observed_at":"2026-08-07T09:07:31.773020Z","submitted_at":"2026-07-17T17:59:27Z","title":"Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T21:09:44.272531Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2607.16189"},"observation_digest":"sha256:7a075789f8f3ccd48f0adf3b55469f85727e34b4172b1bbdb9cfa9a4732d3b13","observation_id":"b7a55875-f353-4b32-9ba8-3b1c1b284223","resolution":{"observed_at":"2026-08-01T21:09:44.272531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-01T11:55:11.477753Z","title":"xgen-mm-vid (blip-3-video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19743","last_updated":"2026-07-22T04:28:38Z","snapshot_observed_at":"2026-08-07T12:47:55.491036Z","submitted_at":"2026-07-22T04:28:38Z","title":"Efficient Tracking and Understanding Object Transformations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T11:55:11.477753Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2607.19743"},"observation_digest":"sha256:84d9bdc64e1579392a81d0c862171418d95ecb396df5c9f0e48965d5dffe5d3b","observation_id":"a8f4a119-5ef0-4545-87e6-4b6fc4e5ed8a","resolution":{"observed_at":"2026-08-01T11:55:11.477753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.16267/citation-record","integrity":"/paper/2410.16267/integrity","json":"/paper/2410.16267/citation-record.json","paper":"/paper/2410.16267"},"outbound":[],"paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2410.16267."}