{"as_of":"2026-08-07T11:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e1663f4b7d3c4d727a105f5e638c6406aa6e28a50124614fab67c49fc6b3834","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T18:25:21.621268Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T05:49:36.807884Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-13T05:52:22.302025Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2603.01400","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.01400","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","venue":"cs.CV","work_id":"ea74b430-6c06-4850-bdb6-5b17e1f1c27f","year":2026},"citing_paper":{"arxiv_id":"2604.16540","last_updated":"2026-04-17T00:48:12Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T00:48:12Z","title":"PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T08:53:40.661558Z"},"links":{"cited_paper":"/paper/2603.01400","citing_paper":"/paper/2604.16540"},"observation_digest":"sha256:97163baf225f77ba38633a046412564d4fc74c427d3f7ce81d85e20a3fd9b9b8","observation_id":"d4204f00-7efd-4621-a236-4d9caf0f85ab","resolution":{"observed_at":"2026-05-10T08:58:12.746045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2603.01400","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.01400","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","venue":"cs.CV","work_id":"ea74b430-6c06-4850-bdb6-5b17e1f1c27f","year":2026},"citing_paper":{"arxiv_id":"2605.11803","last_updated":"2026-05-12T08:58:49Z","snapshot_observed_at":"2026-07-06T23:23:34.924221Z","submitted_at":"2026-05-12T08:58:49Z","title":"OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T05:49:36.807884Z"},"links":{"cited_paper":"/paper/2603.01400","citing_paper":"/paper/2605.11803"},"observation_digest":"sha256:d79999febcc0249f9ec4bf6a5bdca65c0c617116e0e8f39c24c52335a3d42002","observation_id":"e38e845a-639f-486f-8083-1956331cd973","resolution":{"observed_at":"2026-05-13T05:52:22.303693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.01400/citation-record","integrity":"/paper/2603.01400/integrity","json":"/paper/2603.01400/citation-record.json","paper":"/paper/2603.01400"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:da06ec8ef51b15483271a0c69d79b3a51fdcdc8e7604750548a4c9c18d5a83cc","observation_id":"7c10f71f-402b-4d28-871f-b86f7a71bebe","resolution":{"observed_at":"2026-05-15T18:26:26.912056Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"4333adac-a67e-4631-b33e-9384e5b7944a","year":2022},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:b0461e818cef6b16c57ef5b75da579efa1f2f058e561293af5e331b831477567","observation_id":"1253536a-4a15-4c1e-8aee-7b006f87ad0f","resolution":{"observed_at":"2026-05-15T18:26:27.377182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:a0c92866e7084c3ec5acf73bc63e81384c9527e23d86e607aa5a13858a48b7d9","observation_id":"1055f925-b328-461c-b4ae-ae9e7c4202ec","resolution":{"observed_at":"2026-05-15T18:26:26.935702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hired: Attention-guided token dropping for efficient inference of high-resolution vision-language models","venue":null,"work_id":"3b04d4c8-2c05-4e5a-b509-aee63c82019b","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:088582805254b359a205e9d6af25c137e2988c1576eed0dd3ed1fa2eadcaa548","observation_id":"f8cb1e64-111b-4df6-b4c1-364fc4cc487a","resolution":{"observed_at":"2026-05-15T18:26:27.298589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:08fb4e8065586eae7baf44e73cd8b522a2f075f090bf76b82e38908239848994","observation_id":"1974daac-f804-45c3-bfe7-fdf8eed4ac00","resolution":{"observed_at":"2026-05-15T18:26:26.956008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":"2210.09461","doi":"10.48550/arxiv.2210.09461","metadata_source":"pith","pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Token Merging: Your ViT But Faster","venue":"cs.CV","work_id":"528509bc-2611-4e7f-a772-ea14d25b6dae","year":2022},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:ccf8b98c88084de6d0289c94cee773acd2ff40d4da68d133bf19e0a45f0f0b7a","observation_id":"69462350-8708-4509-97f6-41300568aaa4","resolution":{"observed_at":"2026-05-15T18:26:27.061121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:c22609b92f403e59241d5b92975893bbd607b356fbcb8843bcf29042747f86e1","observation_id":"307b969c-1c54-4663-83d5-2209560690f9","resolution":{"observed_at":"2026-05-15T18:26:27.013397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":"5965be46-f3bf-4696-acc5-4908bbb7358a","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:d28b9ce29d17f8af537c638c5a42cd5de6e835d8fcad29991aa148354ff579e3","observation_id":"ba2e3575-e5bf-49a5-ac5c-d197410f1676","resolution":{"observed_at":"2026-05-15T18:26:27.280286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"8b2dbc36-ca9e-49b4-ba7a-bfc427360277","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:dc5380a8b10f1b6f1f61a73bb95691b8308602a89bf828af98e8bdecf31e9fd2","observation_id":"bd15f5b5-a452-4350-a714-280ea226f9e8","resolution":{"observed_at":"2026-05-15T18:26:27.293304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.Science China Information Sciences, 67(12):220101","venue":null,"work_id":"2b877eeb-1eae-493d-a112-aeb4ce5d39c6","year":null},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:fb02af3f89fbc2df6cfe1372d2d078eeac25f28a2fe00ecdf4c86a0e0026cf77","observation_id":"4e4871fc-92c5-47fb-bab8-9107a70e4b50","resolution":{"observed_at":"2026-05-15T18:26:27.277559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:59ab62169f83d710e11b37fe729ca132f8043904df1bb18f132ea93ce5c2df21","observation_id":"5df7632b-e571-4beb-bf7b-51967f4adc3a","resolution":{"observed_at":"2026-05-15T18:26:26.978538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna","venue":null,"work_id":"6d0f7b9d-b8e0-4767-b4ba-7187a3aba2a4","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:228af61c8bd672c1d3328ea7d64991f7a7e95f147c5b26dc06deeca9eb791f4c","observation_id":"ee3ff07b-972b-45f9-bd2a-785c6d92e094","resolution":{"observed_at":"2026-05-15T18:26:27.344774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport","venue":null,"work_id":"f693754d-2c32-449b-8c2e-99ef62d81cf5","year":2013},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:9fc1f891871b4a53a1387498af0208c229c59b04554428eb3d77673cbe556966","observation_id":"cd2cbf18-b934-4781-a422-e2a96b0501eb","resolution":{"observed_at":"2026-05-15T18:26:27.261925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:0de1cfec9af034de5f47ce937df364f5fc1c912b1ec9483c6f23c6fa34b5d687","observation_id":"6e9f6adb-3187-4cd9-92eb-39f2b6bde528","resolution":{"observed_at":"2026-05-15T18:26:26.996414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"9d8f8f9f-d9f3-40a6-b208-85d0eec704d7","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:b31b0efd450f943d32ec874405b86b78d98cb4bd6e2f90a6c3410481b4b03e3e","observation_id":"46372f6a-4618-4cca-b194-81b6f406c0a5","resolution":{"observed_at":"2026-05-15T18:26:27.274073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.01986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framefusion: Combining similarity and importance for video token reduction on large visual language models.arXiv preprint arXiv:2501.01986","venue":null,"work_id":"c9a8af6e-4f98-4562-bdf8-7662216de04b","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:d3bc93b1061b09377a134158d003c82df09a1d3b18a613b6ac4d000acdcf8ab7","observation_id":"f2b099df-6088-4428-8865-d4a635427214","resolution":{"observed_at":"2026-05-15T18:26:26.952439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16117","last_updated":"2024-12-20T18:01:58Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:01:58Z","title":"PruneVid: Visual Token Pruning for Efficient Video Large Language Models","version":1},"cited_work":{"arxiv_id":"2412.16117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16117","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prunevid: Visual to- ken pruning for efficient video large language models","venue":null,"work_id":"019d143a-2a19-4184-a917-91decd8b9788","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2412.16117","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:062c93a54f6b0f566c594aecba0feea8f4c57223f97e6a6e7a6962e2bda0b515","observation_id":"352f6555-5169-49e5-ab23-c28f34d52a3b","resolution":{"observed_at":"2026-05-15T18:26:26.984952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chat-univi: Unified visual representation em- powers large language models with image and video under- standing","venue":null,"work_id":"b053c586-efb6-4b76-82dd-3a5892de7a21","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:bc4dbb8f6b79072069ae1762bd01d66b653818924f7b2ffc9f6a60398431f361","observation_id":"dff2baec-d180-4d96-9c24-da12c23c0a9b","resolution":{"observed_at":"2026-05-15T18:26:27.290323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparsevila: Decoupling visual sparsity for efficient vlm inference","venue":null,"work_id":"37b68111-361a-4c10-9cd5-7282741262ff","year":null},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:8c0e478fab5de41f024b51084c16e440e3e8b6c312fb7ca7b3c2049fada39d47","observation_id":"4478dee3-eee3-4428-a230-199ad501ce69","resolution":{"observed_at":"2026-05-15T18:26:27.322490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.18227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T17:27:15.677725Z","title":"arXiv preprint arXiv:2505.18227 , year=","venue":null,"work_id":"13b6e579-06ad-4c5c-bd41-97a41270caf2","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:dda54d2a30e454e25133b41bc1fa8bdb9f12dd377c87b1192479d353ae2e5299","observation_id":"3dd5e7e3-2fbb-44dd-af9b-fa21596f9abb","resolution":{"observed_at":"2026-05-15T18:26:27.056369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmms-eval: Accelerating the develop- ment of large multimoal models","venue":null,"work_id":"c2088774-94a3-420b-955d-d5b745f75958","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:b2a779557e90316dd56fa71aa0c8c8696af63d31b3751833c19178ce15de65fd","observation_id":"428ecb9f-3562-4fb6-8fa0-dfa92f52b5a5","resolution":{"observed_at":"2026-05-15T18:26:27.308834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:0c735b191e383e237beebdb0b522585bf2754914cd67cbfc0ddedd16c750c7c6","observation_id":"8865f885-a212-4fcb-8ffe-17891dd57711","resolution":{"observed_at":"2026-05-15T18:26:27.041003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expansion and shrinkage of localization for weakly- supervised semantic segmentation.NeurIPS, 35:16037– 16051","venue":null,"work_id":"d6473ef9-80fe-4f0d-ad27-d905a542e0bf","year":2022},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:4cdc4e33c0c9c97350bf28c83f69e5093580fbd58e54faa939e21b1b51728f57","observation_id":"686986fc-58d7-4137-9653-ee300307b388","resolution":{"observed_at":"2026-05-15T18:26:27.328858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"5f3c7eea-4955-421e-a586-a252cdddbfba","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:d4924fe7689235b65a6c1fb5125b512be8c69756fdb839aa024db61c33383388","observation_id":"a2ef54d3-0c89-4a57-8c38-d213e13a7912","resolution":{"observed_at":"2026-05-15T18:26:27.325630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-modal and uncertainty-aware agglomeration for open- vocabulary 3d scene understanding","venue":null,"work_id":"2938e94a-624d-456a-9dff-ebaaaf63e9a7","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:d72bec3b245f1b4bd8bacc7ad181871bb563c5afe3cca04238bd190dfac74a15","observation_id":"21ee01fe-f803-4313-ba9f-37ff6aef794d","resolution":{"observed_at":"2026-05-15T18:26:27.240097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19022","last_updated":"2025-06-23T18:17:39Z","snapshot_observed_at":"2026-08-06T23:11:51.175382Z","submitted_at":"2025-06-23T18:17:39Z","title":"Orthogonal Projection Subspace to Aggregate Online Prior-knowledge for Continual Test-time Adaptation","version":1},"cited_work":{"arxiv_id":"2506.19022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19022","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orthogonal projection subspace to aggregate online prior-knowledge for continual test-time adaptation","venue":null,"work_id":"aebf5336-d4b3-4a97-8b1e-be6d9abb2a00","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2506.19022","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:8b2f4d1c4933444749ff29b9c830ce2a2a493e13ee14654d171739b90495435b","observation_id":"dfa922e3-a8f2-4bc4-9a88-33451116a8f3","resolution":{"observed_at":"2026-05-15T18:26:26.948407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":"2305.06355","doi":"10.48550/arxiv.2305.06355","metadata_source":"pith","pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoChat: Chat-Centric Video Understanding","venue":"cs.CV","work_id":"07461eec-156c-4054-a28e-b84bc53bf6e1","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:6c3effd8f50de9ef6db7d3ffdf97fb09f627231da406d882778586eeb1b51346","observation_id":"b81222d6-1c0c-456b-a895-5978774aac55","resolution":{"observed_at":"2026-05-15T18:26:26.928192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"49f2282f-1a88-4000-9d1c-a8993cd48c25","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:bb2178cc19d3fdb294a29ddcbabfd70ebcc43849c7ee33c83b167af8448ee490","observation_id":"d3c1fd37-8662-4bbe-95d9-8e16c98864c8","resolution":{"observed_at":"2026-05-15T18:26:27.311328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"2ccf439a-34dd-47ff-815d-67f3587f0b21","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:0d7074aa5d9991d9289f73672500617f6b53a535c3315379e1e947bc2975c4f9","observation_id":"0ca99f3f-3ac6-469b-b433-50a8ad459118","resolution":{"observed_at":"2026-05-15T18:26:27.237289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":"2311.10122","doi":"10.48550/arxiv.2311.10122","metadata_source":"pith","pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","venue":"cs.CV","work_id":"e2121c51-a55e-476a-af81-7ba6970fe6cf","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:b48bf5c3b5d4dc4815a2725718ab2d265e098eb104036285a853c264370ddecf","observation_id":"1cc47a42-5cb6-4f36-90de-b608a721c1cc","resolution":{"observed_at":"2026-05-15T18:26:26.944119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"b256796b-55e1-4bb8-85f7-fbe5b17202d0","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:c21be569eb9f4621858d1da01384d48029fa77746d88c7b0476161c152e77620","observation_id":"50387c75-1d4d-413c-9df0-f1c51e32d1cc","resolution":{"observed_at":"2026-05-15T18:26:27.242622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"7de7ab23-a789-4c31-a26f-f0ccb0f6bba1","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:8b6a8d7b24ea11e06b6d8f14a4acba6abd3dba2bf8a0233a6112d7b2ceb31cb7","observation_id":"97643793-6fb5-42a3-85e4-f8ab4c8720ae","resolution":{"observed_at":"2026-05-15T18:26:27.331859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge","venue":null,"work_id":"82573e40-ed62-4c74-b783-cf52f8e53ef4","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:3e7a1e171b2757d752d5b4a0b2c16835295693a465bb1375aeaefad933c8c205","observation_id":"333756eb-327e-4182-94d1-986f82bd549f","resolution":{"observed_at":"2026-05-15T18:26:27.316806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-07-06T19:51:24.166504Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2411.10803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-07-04T14:09:53.785860Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":"d358223e-9ab8-4591-a84a-8e4c1e3296f5","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:c88421cd41e5f1b24be8bcb4f3b769b7e534d59d73c707b654a33a0dab2522a4","observation_id":"c04c2190-6cf4-4248-a223-772acb2fbd56","resolution":{"observed_at":"2026-05-15T18:26:26.920542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Less: Label-efficient and single-stage referring 3d instance segmentation","venue":null,"work_id":"cb099ad3-001e-4833-ad0d-507d7d00ebc4","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:37d60b10a16e58dcdca0c7d0431f97aa1f2fd1a1a70149c6d90e1ce1cfe7fb1c","observation_id":"f78afe71-546c-4bf0-832f-bfe4925584b2","resolution":{"observed_at":"2026-05-15T18:26:27.228851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybrid-level instruction injection for video token com- pression in multi-modal large language models","venue":null,"work_id":"422072fc-0a36-4c00-a9f9-145175075f37","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:3ef985894cb20f3b0b58394ab3741d43c21c8d4ad7c41517d4ea96bac044b9c6","observation_id":"dd783566-e8cb-4ea9-8c0f-855c4dcb10c8","resolution":{"observed_at":"2026-05-15T18:26:27.271560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":"938bd72c-ed99-4a68-ac8b-6b033f385276","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:006aeb205f7d70a8e763a58961e8eb3edfb9300c806db79965e3f2cabe7e8ec1","observation_id":"4b253035-c0cc-4c9a-ad00-75b558830e2b","resolution":{"observed_at":"2026-05-15T18:26:27.256555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":"2306.05424","doi":"10.48550/arxiv.2306.05424","metadata_source":"pith","pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","venue":"cs.CV","work_id":"51f627f4-8fae-4882-a3e9-abdf932ef27b","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:49cc85bd24afac5a29ec9fce60b386e4c73f25f9d0660eb11bd4879143614671","observation_id":"119419f0-a3c9-4320-aa07-95ed7de6e61f","resolution":{"observed_at":"2026-05-15T18:26:26.991401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding","venue":null,"work_id":"7d10f654-b4fb-4d6c-8bbd-2476414b4fc4","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:10fccf5c36a22a3c805703de8c3431d69aa4a6c2658b7cc9778597e697a40262","observation_id":"d8d0dbef-36dc-4286-85f0-503ff62da652","resolution":{"observed_at":"2026-05-15T18:26:27.248078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perla: Perceptive 3d language assistant","venue":null,"work_id":"1f014214-a8ca-43b3-9984-a86a3ec92458","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:66d3a8a107ad4a734bc1e9e542b22a74a2d814a4f057aa791e88edad1cf9fa6d","observation_id":"f2727595-b486-495a-9b65-2650249c2315","resolution":{"observed_at":"2026-05-15T18:26:27.362604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M ´emoire sur la th ´eorie des d ´eblais et des remblais.Mem","venue":null,"work_id":"ea554d1e-5e15-4f87-bdfc-18e3c0e32376","year":null},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:539024bb40da79141ed621e0b02fa203ca76e09477debf0afa3904e225c4ba3e","observation_id":"08caf57a-46e1-4c13-a6bc-39a19e2ebb52","resolution":{"observed_at":"2026-05-15T18:26:27.365862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T2td: Text-3d generation model based on prior knowledge guidance.IEEE Transactions on Pattern Analysis and Machine Intelligence, 47(1):172–189","venue":null,"work_id":"8dd6cfaa-6545-4a73-a47e-9244e7278fea","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:fc77d789af96e318157054c712506e7fdee6bac1df9406159de9b39f071ec504","observation_id":"87e95e8c-7ad4-4f95-af23-b688b1630d64","resolution":{"observed_at":"2026-05-15T18:26:27.352537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"faf5843d-33cd-4b94-96cf-60bb0fe5f51f","year":2021},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:6d33f80517c655adf895c60f3ae9c0b42671bf023f2b942050ab8d5acf0f7419","observation_id":"fad83d17-fa96-4fb7-add5-f142e4908837","resolution":{"observed_at":"2026-05-15T18:26:27.359194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":"32afa88a-b997-4527-b773-5d52fcfaf2ad","year":null},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:8a08b1ffc987de7cef2ccfdc0e56b9580d743ea7d52e7c62c34d30a099bfb49d","observation_id":"d1ae580b-a2b5-4911-9389-01680269bb93","resolution":{"observed_at":"2026-05-15T18:26:27.373553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:08.231383Z","title":"arXiv preprint arXiv:2505.21334 , year=","venue":null,"work_id":"978a927a-78e8-4b65-9e7d-c65444f385b8","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:99697c179075dff025ab88759e44a31a2309facfd8ec35dab502bae2023bddf4","observation_id":"bd723006-e8a7-4702-afa8-a3c10793bff8","resolution":{"observed_at":"2026-05-15T18:26:27.018134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":"2409.01156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-06-30T07:34:22.143661Z","title":"Tempme: Video temporal token merging for efficient text- video retrieval","venue":null,"work_id":"e3e84514-69ce-4dba-a047-ffcc35ffb615","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:60f192eb8a20a325f65e7b627b8a2478c06c3b45057a3a06cb25931338704cc2","observation_id":"e6373ec4-0774-4ee1-8c9a-40bb5e22f222","resolution":{"observed_at":"2026-05-15T18:26:27.050959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.11187","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fastvid: Dynamic density pruning for fast video large language models","venue":null,"work_id":"8059abf0-fec9-49de-87c7-fbe5087032bc","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:95e57b20606b9c169b6272b7579eeaa393a908fa3ddb5f286e9da3c1100d9ac3","observation_id":"6bbf309f-ade3-41ff-a155-ff5a2fe005b9","resolution":{"observed_at":"2026-05-15T18:26:27.024250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":"2410.17434","doi":"10.48550/arxiv.2410.17434","metadata_source":"pith","pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","venue":"cs.CV","work_id":"82f3cbed-22bb-41b5-b9c9-67304154cd52","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:63b014a29e008107970dff6b889e0fb21a661da22bc427434f5a391b8a5a4269","observation_id":"9bc14500-af25-4c75-9f31-cda3689159b6","resolution":{"observed_at":"2026-05-16T13:53:33.725971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"8130fc67-c176-45a4-923d-7f6e16607c41","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:a9c3c2074dbbf1f9e435e18872ca33a51063474baa29c54c90e25196b206bc7f","observation_id":"bfa32464-5aad-4bc0-9041-c8da6c5b5c72","resolution":{"observed_at":"2026-05-15T18:26:27.334653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10501","last_updated":"2025-03-13T16:04:31Z","snapshot_observed_at":"2026-07-06T20:52:04.228632Z","submitted_at":"2025-03-13T16:04:31Z","title":"TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.10501","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10501","snapshot_observed_at":"2026-07-01T22:16:15.601342Z","title":"To- kencarve: Information-preserving visual token compres- sion in multimodal large language models","venue":null,"work_id":"1a513a26-4a37-4286-bf16-447b3f1b56bd","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2503.10501","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:dac2e467bcd59b028a95393010e680751152f4e96a502fdb0a009ed1cde71916","observation_id":"989474e8-b56d-4783-82f1-5a2c5cb5ac92","resolution":{"observed_at":"2026-05-15T18:26:27.066331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dycoke: Dynamic compression of tokens for fast video large language models","venue":null,"work_id":"af3ef218-fc5f-4fb2-83b2-9f01a4872883","year":null},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:f8862404dec3e0dc31c41f83dc46e33ac3b1fccd7aea195217dc2ac6b511b092","observation_id":"7588e5c2-9c25-4a18-8251-fd0d9493dfd5","resolution":{"observed_at":"2026-05-15T18:26:27.337712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stanford alpaca: An instruction-following llama model","venue":null,"work_id":"0a12884c-339d-48aa-b7dc-086dfd9a48b4","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:81f7cd1b480c3dd396715447e807322a1c79fc3d9e5372957ebee225ca56e925","observation_id":"52a2c208-bf56-4fd8-a039-25a8e104e1ea","resolution":{"observed_at":"2026-05-15T18:26:27.340873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:8cbc23df15ef326a33b54f40a3099532d1d488447c1b6d2ddb024826a2e8c3ea","observation_id":"13e0de41-33bf-4729-85de-bf7be3322db2","resolution":{"observed_at":"2026-05-15T18:26:26.924185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:1ff1fce48c74d49f596b9913bc69b1e948251d215d62290239326555c9bf24dc","observation_id":"27654a1b-7146-4301-a713-b381a7990ea8","resolution":{"observed_at":"2026-05-15T18:26:26.931899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introduction to optimal transport.Notes of Course at University of Cambridge, 3","venue":null,"work_id":"b1443a95-7cd0-4828-af8b-2b32acf7d96f","year":2018},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:77dfaffce37debe16de8d58352e696581c2d701e5fd8512e1d597f90dba182a6","observation_id":"31b238ec-1cb4-4325-8768-9d21905c70d2","resolution":{"observed_at":"2026-05-15T18:26:27.234249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Springer","venue":null,"work_id":"559b5ef8-116c-4ac6-ba46-1e8954292ece","year":2008},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:5ac04248389f201541e6ee5a0f19d3b857705e56e00aba25ce8abdad9ccf6406","observation_id":"d5e2a7a3-8853-4cc8-93b2-0d7d378f2015","resolution":{"observed_at":"2026-05-15T18:26:27.253693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ross3d: Re- constructive visual instruction tuning with 3d-awareness","venue":null,"work_id":"091cbe72-cfbe-424c-ba60-9237659b6140","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:f86af99d14637c3a3b4d3e0a8f4f11e84053690c821bb3808a20540babebb3a1","observation_id":"41ed44ae-c1df-4774-9b91-4580736da2aa","resolution":{"observed_at":"2026-05-15T18:26:27.314206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14407","last_updated":"2023-04-29T03:48:26Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:59:58Z","title":"ChatVideo: A Tracklet-centric Multimodal and Versatile Video Understanding System","version":2},"cited_work":{"arxiv_id":"2304.14407","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14407","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatvideo: A tracklet-centric multimodal and versatile video understanding system","venue":null,"work_id":"bd186832-fce9-4e7a-845b-19a5d5673de2","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2304.14407","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:2ed0be40bf341a675969bd7118c66b3f0fb5f80bd3a2657cda9cddc30863db07","observation_id":"5763ab29-2d37-442c-86c7-bfe7cc13504d","resolution":{"observed_at":"2026-05-15T18:26:27.035766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uvmap-id: A controllable and personalized uv map generative model","venue":null,"work_id":"c6243cce-63ab-47d7-aa3b-1af54037e314","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:289f4c156045cdf3534b4174b710d46d0f687cb6e988fe09ee55637b1a889338","observation_id":"e54f96a9-a8cd-4e1e-8374-b0af4b18f2b0","resolution":{"observed_at":"2026-05-15T18:26:27.370028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11494","last_updated":"2025-06-08T08:35:58Z","snapshot_observed_at":"2026-07-06T20:37:37.864423Z","submitted_at":"2025-02-17T06:56:28Z","title":"Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More","version":2},"cited_work":{"arxiv_id":"2502.11494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11494","snapshot_observed_at":"2026-07-02T21:37:24.192533Z","title":"Stop looking for important tokens in multimodal language models: Duplication matters more","venue":null,"work_id":"7e75ec79-7667-4044-b9eb-4a4f4723e639","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2502.11494","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:edd8ecd6f86df58cfbaf4e851d93c216e4e5e36c9cc1f39789033c71b65c3576","observation_id":"fa469ff6-c5a0-423b-a471-560860c4103d","resolution":{"observed_at":"2026-05-15T18:26:27.002398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longvlm: Efficient long video understand- ing via large language models","venue":null,"work_id":"7cd35569-03a2-4fea-8d60-2875e43373cf","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:344e59deeadeba74dd89e25326b44fe1b93982e7a4303d0a8af78e41b84e63ea","observation_id":"936eb09b-3111-47d2-a29e-0e6f8d874e28","resolution":{"observed_at":"2026-05-15T18:26:27.267065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:c42ad578776ffc2f4bc9999367e59efd354ddd207f6d9b58e7c5260522748b3c","observation_id":"0233a267-69d2-4fe4-8eb5-4edf7cdeec25","resolution":{"observed_at":"2026-05-15T18:26:26.964302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"8fa39a78-d131-4bc8-84ed-22c3441bd77f","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:a399b535aa404bbfa03bbcc4424482712fb9080ab0a98414a7769baf35b6cb5c","observation_id":"a5f3a305-0905-4ffe-9d69-5e604be1e28e","resolution":{"observed_at":"2026-05-15T18:26:27.284735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":"2410.17247","doi":"10.48550/arxiv.2410.17247","metadata_source":"pith","pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","venue":"cs.CV","work_id":"ca5cea36-45c6-4d00-8408-14876a5d59c3","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:3de235445bb507f6e19a4fab5abcc18662861349ceed3395ccb4ce1fe90798f5","observation_id":"2037e54b-31c8-416e-b5fc-ae29cfee9e3a","resolution":{"observed_at":"2026-05-15T18:26:26.974162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conical visual concentration for efficient large vision-language models","venue":null,"work_id":"7a45f654-04a9-469d-a434-b49694aec78c","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:ec91cb0dff9685afddd7a5c628ebcb9ff829e1fce107cff0a11fb8bc549b926c","observation_id":"dc8c9f21-d6f1-439f-9ab8-4caacc9ff7d8","resolution":{"observed_at":"2026-05-15T18:26:27.287311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":"2404.16994","doi":"10.48550/arxiv.2404.16994","metadata_source":"pith","pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","venue":"cs.CV","work_id":"8949d4db-20f2-47c1-83a6-fcbe041b62ef","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:4f926bc3963e9b88b0265a6a654678b7cb0e9a76534214b350cc71b76dec4a65","observation_id":"6c7c6dd1-3510-4128-a3f6-85ee4a6f7e05","resolution":{"observed_at":"2026-05-15T20:21:58.165262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Topv: Compatible token pruning with infer- ence time optimization for fast and low-memory multimodal vision language model","venue":null,"work_id":"9940e720-5747-4ff4-bfd8-b30273ebb3a8","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:6fb565bf98eb5cf935fa69292e0a9b1fcb5e70c9cb2a1e654d4c0d317d12844c","observation_id":"910a5ad1-c5bd-4f2a-bf96-d8646a932163","resolution":{"observed_at":"2026-05-15T18:26:27.231490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":"1d4badc5-90ae-43e1-a7cc-4b7e4761b40f","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:f2d47d4a701cbe99855e83fa8bcf405dce880416956e9966d9f65963167f3658","observation_id":"6bb79c97-e5cc-467c-9eff-f274ef67b8d8","resolution":{"observed_at":"2026-05-15T18:26:27.301957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Atp-llava: Adaptive token pruning for large vision language models","venue":null,"work_id":"bd6128dc-02d7-47f4-8ead-d4d844eef51c","year":null},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:c837f946a4befb0a81da516d5cd9eb37bef0865b2215c7bef68d5364cad620b4","observation_id":"9b795a22-c186-4d82-9ceb-07e2ef51ca43","resolution":{"observed_at":"2026-05-15T18:26:27.319661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video question answering with prior knowledge and object-sensitive learning.IEEE Transactions on Image Processing, 31:5936–5948","venue":null,"work_id":"01e9c601-3690-4f7d-9429-0a5903bc94fa","year":2022},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:81b82b20161de91ac20bd52cad0115062a0450d6866b731644277f908a98fd79","observation_id":"497c6d8d-8b7b-422b-a3cc-707d95f77df8","resolution":{"observed_at":"2026-05-15T18:26:27.269399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"2f1befbe-2a36-4b74-98d4-b4112d820337","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:04e1b7c520c78ec13e43bbc08483c2097eaca9f20b6b2b3fb14cc036c7731a09","observation_id":"19451f1f-e827-4dee-9245-d8da96bf0313","resolution":{"observed_at":"2026-05-15T18:26:27.251311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.22654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:09:53.807829Z","title":"arXiv preprint arXiv:2505.22654 , year=","venue":null,"work_id":"722ef313-9de6-4921-85a9-66158d76c41b","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:03190e0960fe991a9238e142ac3f64bca3183b2184b074ff31dcdb234ffd5e89","observation_id":"7accfd02-4002-4099-bac7-57c4f08f4157","resolution":{"observed_at":"2026-05-15T18:26:27.008012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":"2306.02858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-04T16:29:57.761121Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":"cs.CL","work_id":"555cf04a-49a7-44b8-9019-a83ce85ace95","year":2023},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:f61cd384b61c0994cf6f23726de8d41c73e44ea742845f08aa56af0c1e8a3e1f","observation_id":"1fa2b1de-1857-4a5b-ae05-2bf9db620fb5","resolution":{"observed_at":"2026-05-15T18:26:27.046262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnicharacter: Towards immersive role- playing agents with seamless speech-language personality interaction","venue":null,"work_id":"5bf241bf-ece3-4724-8f7e-caa54492cd25","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:75c8f757179e0caf9d4f05640a26c3ab91cd2a7679228f8bf8d902f8e42baa4e","observation_id":"da801dc0-aab0-4ce9-ad44-52e5365121a7","resolution":{"observed_at":"2026-05-15T18:26:27.356002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text-video re- trieval with global-local semantic consistent learning.IEEE Transactions on Image Processing","venue":null,"work_id":"a3f69aa7-3c02-4dda-9b00-d6213ef05430","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:586c7266dce9962c73fafe0bd1f3c7f3315cf6a6aa27b9eb8c32b78c108c6db7","observation_id":"d6442c55-87c2-4295-8a0d-5f0a1c26eeb9","resolution":{"observed_at":"2026-05-15T18:26:27.259230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmms-eval: Re- ality check on the evaluation of large multimodal models","venue":null,"work_id":"ee4d9603-9ed6-4c73-94ca-fdd68cfeabc0","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:fb0ce111af60d9a77ffa03f6a15df3f429a7e2d25c47a8823b59446c0e3f7e20","observation_id":"0360cb4f-239e-43ce-a38b-344b429992d2","resolution":{"observed_at":"2026-05-15T18:26:27.348659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"[cls] attention is all you need for training-free visual token pruning: Make vlm inference faster.arXiv e- prints, pages arXiv–2412","venue":null,"work_id":"2e703888-7f8c-47da-8f30-2ab54dbb6db3","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:877cb0bf64fa613eba67e225d7340fbc9b35448fb6d205e3e72ab1e9ea08fcec","observation_id":"6d743b53-706a-4d33-b0e2-5707633b4264","resolution":{"observed_at":"2026-05-15T18:26:27.245048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:04647dfd5033e4a7b6bf5af60fc58e1b613e1681ad587a3e5ad7af7c889ac398","observation_id":"6d510b01-19d4-4d2f-8829-9cf4b29286e2","resolution":{"observed_at":"2026-05-15T18:26:27.029877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava- next: A strong zero-shot video understanding model","venue":null,"work_id":"b8c8842c-0f8f-4d69-aadc-94d34e76b12e","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:2f91e2111ea3571cf5a4a415c7f9a1625791339161b5eece5c52bbea15177622","observation_id":"3630be8a-844e-43a2-a638-af0d7ff4f7fd","resolution":{"observed_at":"2026-05-15T18:26:27.264782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":"2410.02713","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-07-09T21:36:34.348434Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","venue":"cs.CV","work_id":"e598f516-d992-449a-ab6d-6c788b3a1d7b","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:550eee0dda8a32aa5bec1c8c56f5f8c0bf9a65c5aa794f8ada036f305ed86848","observation_id":"29b998a0-8613-4a1a-a67d-e000e269443c","resolution":{"observed_at":"2026-05-15T18:26:26.969533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding","venue":null,"work_id":"322d7843-2d50-486c-905d-c18129d49f68","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:f93b46c562f3dc89cda21c4e20cb432b527f8e0bc88a1174072054425efe1715","observation_id":"32f9a511-da57-4916-ac08-9d42fb29f604","resolution":{"observed_at":"2026-05-15T18:26:27.295927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":"2409.18125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-07-04T15:39:56.857028Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness","venue":null,"work_id":"25557a62-345c-4dfe-a582-4ff77ad59e6a","year":2024},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:f1c1fd9442f6744689109c4c02745811a97f8e1da8f99f34ede4713d39858d94","observation_id":"bf521ba6-1604-4758-b59a-e5446d40d410","resolution":{"observed_at":"2026-05-15T18:26:26.916148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:b86f199106c6cee9e44bfe138d4cf20a4fdc842bbf6774a197914e57a3729ea5","observation_id":"0c57d810-ae1e-4d7e-81fc-2223d5a8a1ef","resolution":{"observed_at":"2026-05-15T18:26:27.070691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Apollo: An explo- ration of video understanding in large multimodal models","venue":null,"work_id":"53597f1a-c0a4-4b30-a247-c84e869f43b5","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:ff73bd4635b04bc3761e5681d40f463ed5a5032241402c22fd068d8bd8641cfd","observation_id":"07e72e4f-10d8-46c3-b257-6b3bfdb52187","resolution":{"observed_at":"2026-05-15T18:26:27.306236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T10:23:03.986323Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":34,"verified_fuzzy":50},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 2 inbound Pith citation observations for arXiv:2603.01400."}