{"as_of":"2026-08-12T13:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:490a92b08909bd715fe9e1c4710692fdc7af0f0e344ae4e763990fd9fda0f153","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:25:00.324543Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.06764","doi":"10.48550/arxiv.2403.06764","metadata_source":"pith","pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":"cs.CV","work_id":"b09c06ba-a6cd-48cf-83f7-30a010a04ef4","year":2024},"citing_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T09:58:29.057357Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2406.02069"},"observation_digest":"sha256:c6dafde37923ebf323f6999dc2c876c47c3f30cdcbedf2a4e9f34d5cfaec2152","observation_id":"36fb42a2-82c2-44de-8e31-e2539c974c31","resolution":{"observed_at":"2026-05-12T09:58:29.106770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.06764","doi":"10.48550/arxiv.2403.06764","metadata_source":"pith","pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":"cs.CV","work_id":"b09c06ba-a6cd-48cf-83f7-30a010a04ef4","year":2024},"citing_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-16T17:41:03.674759Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2410.10781"},"observation_digest":"sha256:86e95d42ad3b84864562b82c12f453f2bbd218d6712aa8df47ac93b62e009250","observation_id":"9129ef6c-85f5-4afb-9e3d-acebd4def756","resolution":{"observed_at":"2026-05-16T17:41:03.797181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.06764","doi":"10.48550/arxiv.2403.06764","metadata_source":"pith","pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":"cs.CV","work_id":"b09c06ba-a6cd-48cf-83f7-30a010a04ef4","year":2024},"citing_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T12:12:14.613620Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2410.17247"},"observation_digest":"sha256:0cfd3e65be31cfafb78d46843cec6830e1ac4bdedea89e6d196f9ca109fd8dba","observation_id":"bd0e560b-a626-4864-acc2-3525f206e579","resolution":{"observed_at":"2026-05-15T12:12:14.760555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-12T12:25:00.324543Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-12T12:17:45.770635Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.324543Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:6d02802521130eab643f42d2795b5123c03c8bb89f64ba98caaf05c8150554a6","observation_id":"d47b8885-67fb-41c9-b767-57ae6ed2ef53","resolution":{"observed_at":"2026-08-12T12:25:00.324543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-12T06:04:21.815034Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19628","last_updated":"2025-07-25T10:41:09Z","snapshot_observed_at":"2026-08-12T07:18:32.323407Z","submitted_at":"2024-11-29T11:24:23Z","title":"Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T06:04:21.815034Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2411.19628"},"observation_digest":"sha256:7cb9912a1a0ef866d73511b3005c09a57f349b299ebb0b97da60d5bc7ca73db0","observation_id":"0f5753ea-e6f4-4547-a809-2f18a63c6689","resolution":{"observed_at":"2026-08-12T06:04:21.815034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-12T00:57:32.397998Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-12T00:51:37.491731Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:57:32.397998Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.01818"},"observation_digest":"sha256:5c695b5252b991a0290f05c286819584692a8cb7607e4094aceeef09bfdc623e","observation_id":"2f00ea8d-456e-46c8-bfde-d319e9726ef2","resolution":{"observed_at":"2026-08-12T00:57:32.397998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T23:54:23.806149Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision- language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02104","last_updated":"2024-12-03T02:54:31Z","snapshot_observed_at":"2026-08-12T00:49:07.041510Z","submitted_at":"2024-12-03T02:54:31Z","title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","version":1},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-08-11T23:54:23.806149Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.02104"},"observation_digest":"sha256:71fc90a7940e1bfc47de6b71143a29a45bedef1d6fed1db8d9e8931ee5c64325","observation_id":"9ece6cac-4691-4b1a-8bbb-3c84f29e0dc9","resolution":{"observed_at":"2026-08-11T23:54:23.806149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T22:35:24.150592Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03324","last_updated":"2024-12-05T12:52:31Z","snapshot_observed_at":"2026-08-11T22:29:21.460148Z","submitted_at":"2024-12-04T13:56:44Z","title":"A Stitch in Time Saves Nine: Small VLM is a Precise Guidance for Accelerating Large VLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:35:24.150592Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.03324"},"observation_digest":"sha256:74fd56c1d54a361c11cd395a0a518acb60ead928ce66766dce6717c4ef4ca8da","observation_id":"7a680d99-9396-4a95-a4fa-dd313db57ba8","resolution":{"observed_at":"2026-08-11T22:35:24.150592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T21:37:08.246133Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.246133Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:c27f3de0126492dc254888cebe3ba1116717c9f1cdd662d9b1130feac7847425","observation_id":"c5ce3a98-1b80-4e69-8f83-431aa4261138","resolution":{"observed_at":"2026-08-11T21:37:08.246133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T20:23:18.491097Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-12T04:14:49.076577Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:23:18.491097Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.05819"},"observation_digest":"sha256:cfd73eb113cc475beb6b9359ed20af2d8c72d5a28036d6bc9c3860f7c10d50f7","observation_id":"a1f51f80-4cd2-4477-b5aa-eaf8a52d8ad6","resolution":{"observed_at":"2026-08-11T20:23:18.491097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T16:45:44.677283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09817","last_updated":"2024-12-13T03:13:44Z","snapshot_observed_at":"2026-08-12T04:14:50.154967Z","submitted_at":"2024-12-13T03:13:44Z","title":"Enhancing Multimodal Large Language Models Complex Reason via Similarity Computation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T16:45:44.677283Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.09817"},"observation_digest":"sha256:a3b90c58f7cdacb0556ef8665d6f91ebc4e1aa6fb45b31898cdff6f242d6fcde","observation_id":"c065c839-cc18-4729-a2f2-bd9c412471da","resolution":{"observed_at":"2026-08-11T16:45:44.677283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T15:33:13.065992Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10958","last_updated":"2025-03-14T22:22:40Z","snapshot_observed_at":"2026-08-11T15:24:51.194871Z","submitted_at":"2024-12-14T20:29:29Z","title":"SoftVQ-VAE: Efficient 1-Dimensional Continuous Tokenizer","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:33:13.065992Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.10958"},"observation_digest":"sha256:257d4f62738d74b5ada855747a3f553c3c14dfc80ce03ef153f1f1bac46df794","observation_id":"2096eee0-1f88-45ef-b2c8-ede51a9c376a","resolution":{"observed_at":"2026-08-11T15:33:13.065992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T14:13:24.425557Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12359","last_updated":"2025-01-07T15:36:54Z","snapshot_observed_at":"2026-08-12T09:02:43.852456Z","submitted_at":"2024-12-16T21:14:11Z","title":"LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T14:13:24.425557Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.12359"},"observation_digest":"sha256:f6fa2963d85934c556606155de14ebc53b3e08cb012589d984d2818fa8b5935f","observation_id":"fd6205dd-cbcc-42d1-ba3b-e588e9721631","resolution":{"observed_at":"2026-08-11T14:13:24.425557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T14:59:01.350120Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.350120Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:0ab0fded36693d59cc1d223898b468b8e4df71825458b9185339390df0746b00","observation_id":"f29064d1-35f5-4560-81fa-fbeecb340d41","resolution":{"observed_at":"2026-08-11T14:59:01.350120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-10T23:39:18.051553Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20105","last_updated":"2024-12-28T10:17:29Z","snapshot_observed_at":"2026-08-10T23:30:14.051344Z","submitted_at":"2024-12-28T10:17:29Z","title":"ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T23:39:18.051553Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.20105"},"observation_digest":"sha256:8abeadaa943a457b5b8c79f0f16892f135dc5f3fe08371e0e30556b3a60133e3","observation_id":"b0a3ddb1-62de-458c-86b4-b28932ba393f","resolution":{"observed_at":"2026-08-10T23:39:18.051553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-10T22:17:27.472844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.472844Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:04073b3bff7afcdb73728650658fe42a66bc039f585364818aed168ebbe14804","observation_id":"5d19ddcd-8134-4d6a-bcfb-06d07fa22729","resolution":{"observed_at":"2026-08-10T22:17:27.472844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-10T22:20:45.651882Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02268","last_updated":"2025-01-04T12:14:42Z","snapshot_observed_at":"2026-08-12T04:14:52.887268Z","submitted_at":"2025-01-04T12:14:42Z","title":"What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T22:20:45.651882Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2501.02268"},"observation_digest":"sha256:629d3e43ddf963148bec65386b0384576c4c93107d3e43e41e923890c1d15c58","observation_id":"d03d0134-b4ca-4520-9a68-69b6cf1a6e6e","resolution":{"observed_at":"2026-08-10T22:20:45.651882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-10T21:23:57.853494Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05037","last_updated":"2025-03-27T09:39:11Z","snapshot_observed_at":"2026-08-10T21:17:52.245219Z","submitted_at":"2025-01-09T07:51:14Z","title":"LongViTU: Instruction Tuning for Long-Form Video Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:23:57.853494Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2501.05037"},"observation_digest":"sha256:40853edd4e3526cf6e515638ce1ee10c401b581d25d32ff180ff86ec5fed12b7","observation_id":"23577145-6b84-427d-b468-7100293c016a","resolution":{"observed_at":"2026-08-10T21:23:57.853494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-10T20:00:12.568815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09532","last_updated":"2025-02-01T06:13:27Z","snapshot_observed_at":"2026-08-10T19:53:11.323533Z","submitted_at":"2025-01-16T13:34:33Z","title":"AdaFV: Rethinking of Visual-Language alignment for VLM acceleration","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:00:12.568815Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2501.09532"},"observation_digest":"sha256:bee16fa3a44946a83bcc6751a7dc7d20927ffc439dae80a779dd1b49f51b8f41","observation_id":"2a5d5a1f-e4c3-41a6-96a5-2e4d0b889939","resolution":{"observed_at":"2026-08-10T20:00:12.568815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-07T11:59:05.780757Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:05.780757Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:d34bb734060989c42a95618d4dc3ff042d0d9f486cea9c8b584b552801211e91","observation_id":"ec529799-0e10-4035-b845-b9cc040f1b06","resolution":{"observed_at":"2026-08-07T11:59:05.780757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-07T00:42:53.610866Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.610866Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:32dbe0ccbe22d5e77c6c3d52df8bfbc2b4bdebb197d96426590593051312b67c","observation_id":"6dc287d1-f569-467c-a16f-9564fbd18c74","resolution":{"observed_at":"2026-08-07T00:42:53.610866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-06T20:29:48.568606Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:48.568606Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:09b68555992e47653742a5e10bc4fd9cdd07b157dc8cf97f96b85e3ab0437d42","observation_id":"eef22555-b744-4038-8e00-8a46b63f3888","resolution":{"observed_at":"2026-08-06T20:29:48.568606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.06764","doi":"10.48550/arxiv.2403.06764","metadata_source":"pith","pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":"cs.CV","work_id":"b09c06ba-a6cd-48cf-83f7-30a010a04ef4","year":2024},"citing_paper":{"arxiv_id":"2507.21420","last_updated":"2026-04-28T19:54:45Z","snapshot_observed_at":"2026-08-11T08:12:42.121511Z","submitted_at":"2025-07-29T01:07:09Z","title":"ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-19T03:18:11.993413Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2507.21420"},"observation_digest":"sha256:a21b84013b2108785a6910ef890dad83282429d264edad71acf0617071e8b5ff","observation_id":"c3b71c14-67de-4ccb-8b88-9e3581a2ebf3","resolution":{"observed_at":"2026-05-19T03:22:01.165421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-04T19:47:08.908760Z","title":"Qizhe Zhang, Aosong Cheng, Ming Lu, Renrui Zhang, Zhiyong Zhuo, Jiajun Cao, Shaobo Guo, Qi She, and Shanghang Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09090","last_updated":"2025-09-11T01:52:25Z","snapshot_observed_at":"2026-08-10T18:08:56.776726Z","submitted_at":"2025-09-11T01:52:25Z","title":"SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:47:08.908760Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2509.09090"},"observation_digest":"sha256:827030913cb36ef4d69e1e68dadc2f421416779ad70cfa991b8910e4532ae02b","observation_id":"b6e18987-f9be-456d-8b71-e8b2d7397529","resolution":{"observed_at":"2026-08-04T19:47:08.908760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.06764","doi":"10.48550/arxiv.2403.06764","metadata_source":"pith","pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":"cs.CV","work_id":"b09c06ba-a6cd-48cf-83f7-30a010a04ef4","year":2024},"citing_paper":{"arxiv_id":"2603.07080","last_updated":"2026-04-29T05:35:06Z","snapshot_observed_at":"2026-08-11T11:49:33.350179Z","submitted_at":"2026-03-07T07:30:35Z","title":"VLN-Cache: Enabling Token Caching for VLN Models with Visual/Semantic Dynamics Awareness","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:58.269817Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2603.07080"},"observation_digest":"sha256:b59191c07bceaea87a3464b69fa95a7c8393a2f7d3a994b7cfe59d68b5589c78","observation_id":"9f662f41-9e89-4102-bdfd-12827c0e3094","resolution":{"observed_at":"2026-05-15T14:51:08.157390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.06764","doi":"10.48550/arxiv.2403.06764","metadata_source":"pith","pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":"cs.CV","work_id":"b09c06ba-a6cd-48cf-83f7-30a010a04ef4","year":2024},"citing_paper":{"arxiv_id":"2604.09442","last_updated":"2026-04-10T15:58:31Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T15:58:31Z","title":"UIPress: Bringing Optical Token Compression to UI-to-Code Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:32.024105Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2604.09442"},"observation_digest":"sha256:634ee3069ba10b20f2e0215b83d7c9ff1f65a58a609812a5f22ca376be559614","observation_id":"fa624b16-8128-423d-b260-c53fb5913a90","resolution":{"observed_at":"2026-05-11T07:00:59.145920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.06764","doi":"10.48550/arxiv.2403.06764","metadata_source":"pith","pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":"cs.CV","work_id":"b09c06ba-a6cd-48cf-83f7-30a010a04ef4","year":2024},"citing_paper":{"arxiv_id":"2604.12358","last_updated":"2026-04-15T17:43:53Z","snapshot_observed_at":"2026-08-11T10:41:47.822598Z","submitted_at":"2026-04-14T06:48:31Z","title":"Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T14:50:37.022338Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2604.12358"},"observation_digest":"sha256:812be70201de4acc0600671e2ebb68b18a867038035ae62ab52ec046541cc7b8","observation_id":"d2dc88b3-4605-468a-be51-2b4b43c1932e","resolution":{"observed_at":"2026-05-11T11:31:01.435400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.06764","doi":"10.48550/arxiv.2403.06764","metadata_source":"pith","pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":"cs.CV","work_id":"b09c06ba-a6cd-48cf-83f7-30a010a04ef4","year":2024},"citing_paper":{"arxiv_id":"2605.30904","last_updated":"2026-05-29T06:38:10Z","snapshot_observed_at":"2026-07-06T23:40:07.833692Z","submitted_at":"2026-05-29T06:38:10Z","title":"MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T22:42:20.280777Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2605.30904"},"observation_digest":"sha256:ec53704ed64573204efc160fa2102d992ced427b1af15e4143ac48bcdd37039c","observation_id":"28558941-b8c5-4d6e-bbee-b078bb5e5ee3","resolution":{"observed_at":"2026-06-28T22:42:46.050833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.06764","doi":"10.48550/arxiv.2403.06764","metadata_source":"pith","pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":"cs.CV","work_id":"b09c06ba-a6cd-48cf-83f7-30a010a04ef4","year":2024},"citing_paper":{"arxiv_id":"2606.09131","last_updated":"2026-06-08T07:28:14Z","snapshot_observed_at":"2026-08-07T20:04:49.687813Z","submitted_at":"2026-06-08T07:28:14Z","title":"Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T16:32:09.784716Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2606.09131"},"observation_digest":"sha256:0cd83beb90d6355d0c384955c2042b127735cefa8b03f40afa2a7f3e05b53f32","observation_id":"e041da95-08fc-4b5b-9c5a-86ac38731e6e","resolution":{"observed_at":"2026-06-27T16:41:03.346578Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2403.06764 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:290ccfec864eb5ac702874bad3929074075e4ee19b4bd648b1b53ab988c7ac75","observation_id":"6e8e6ee6-fd67-4474-a552-bad8bf3905f7","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.06764","doi":"10.48550/arxiv.2403.06764","metadata_source":"pith","pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":"cs.CV","work_id":"b09c06ba-a6cd-48cf-83f7-30a010a04ef4","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:947962a0d502d9caefe62df72e370a5f0178746bb0255951f35b0e61e0e19e9d","observation_id":"a8b5b3c8-cc53-4915-913d-0bbd6b662b3b","resolution":{"observed_at":"2026-07-08T22:35:40.573081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.06764","doi":"10.48550/arxiv.2403.06764","metadata_source":"pith","pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":"cs.CV","work_id":"b09c06ba-a6cd-48cf-83f7-30a010a04ef4","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:6c6caaa7932a787d2bc9747b42219c1dce76a0f3f56490a84a510520eb9f6dd6","observation_id":"0dbb35f5-9537-4245-861d-e21d3fa3da83","resolution":{"observed_at":"2026-07-10T01:36:43.980109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-02T01:48:49.788167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14557","last_updated":"2026-07-16T04:37:02Z","snapshot_observed_at":"2026-08-07T01:49:31.068808Z","submitted_at":"2026-07-16T04:37:02Z","title":"Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T01:48:49.788167Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2607.14557"},"observation_digest":"sha256:7c6d1741920e3f4a975f1874afc0a440a4528efdec674507070633fd50cf8db8","observation_id":"8c008f01-dadb-4eac-8bac-6ab703a44618","resolution":{"observed_at":"2026-08-02T01:48:49.788167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-01T05:34:45.516112Z","title":"arXiv:2403.06764","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22200","last_updated":"2026-07-24T11:13:44Z","snapshot_observed_at":"2026-08-03T08:02:50.850496Z","submitted_at":"2026-07-24T11:13:44Z","title":"LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T05:34:45.516112Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2607.22200"},"observation_digest":"sha256:3c7a5d1adfd59397a2dcf8615fe03fc97105584eb4384c7031be269ca2410b6f","observation_id":"449bde39-58e9-4d03-a245-820be3235440","resolution":{"observed_at":"2026-08-01T05:34:45.516112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-04T00:46:04.099639Z","title":"Davenport, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00345","last_updated":"2026-07-31T23:27:39Z","snapshot_observed_at":"2026-08-07T08:23:31.458624Z","submitted_at":"2026-07-31T23:27:39Z","title":"ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T00:46:04.099639Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2608.00345"},"observation_digest":"sha256:67c19fbfc92aac326d9e745eab41a8c2feeaeaa23b371f5a9948106ef73cc759","observation_id":"90366d26-3421-42e0-8ded-37882f2138cf","resolution":{"observed_at":"2026-08-04T00:46:04.099639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-04T23:46:51.546718Z","title":"European Conference on Computer Vision (ECCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-10T14:57:44.819541Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.546718Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:9c0834ad3c8a9838a2b2c8902e43ee18751063db566f044af40e593bf9e96402","observation_id":"818cb237-c809-4edf-a4ac-13d5b653a7be","resolution":{"observed_at":"2026-08-04T23:46:51.546718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T16:41:28.812887Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03580","last_updated":"2026-08-04T12:34:46Z","snapshot_observed_at":"2026-08-10T21:11:28.904829Z","submitted_at":"2026-08-04T12:34:46Z","title":"SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:41:28.812887Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2608.03580"},"observation_digest":"sha256:5e13168352b6262b540a04af3f5064406e92e7dc48495f8f24925a2ecc43fde5","observation_id":"b3db6853-5d03-492e-8259-085086b20159","resolution":{"observed_at":"2026-08-05T16:41:28.812887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T12:53:13.935715Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models.arXiv preprint arXiv:2403.06764, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09682","last_updated":"2026-08-10T14:52:10Z","snapshot_observed_at":"2026-08-12T12:26:03.280103Z","submitted_at":"2026-08-10T14:52:10Z","title":"Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:53:13.935715Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2608.09682"},"observation_digest":"sha256:221b0f0415d2f1d6b08965f05a5696d0c74ab1513cd13c56d2cefb5190a52bb3","observation_id":"54c530f6-4381-45b3-8282-d55da1520d61","resolution":{"observed_at":"2026-08-11T12:53:13.935715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.06764/citation-record","integrity":"/paper/2403.06764/integrity","json":"/paper/2403.06764/citation-record.json","paper":"/paper/2403.06764"},"outbound":[],"paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2403.06764."}