{"as_of":"2026-08-19T08:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dede04648192e2a653d25df98333875cda867bf3bb0e2d17ced62f2ac26ed7f5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:47:27.417308Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:57.301173Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.20985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-07-04T16:39:57.301173Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":"72b8bcdd-c399-4415-a8e7-ca6f24d31b48","year":2024},"citing_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-08-15T01:31:24.363496Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-15T14:58:32.303101Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2410.04417"},"observation_digest":"sha256:bcebba9b24a96694b387509cf1632f377646111482e4af26c63485db98ce168a","observation_id":"139efa7c-ec3a-43f4-b657-741794c2b013","resolution":{"observed_at":"2026-05-15T14:58:32.399310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.20985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-07-04T16:39:57.301173Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":"72b8bcdd-c399-4415-a8e7-ca6f24d31b48","year":2024},"citing_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-08-12T14:42:48.682739Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T12:12:14.613620Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2410.17247"},"observation_digest":"sha256:d6ff0f7f513d43a2b910f3c22bd47d8b718c7171a8e27c8197b8ff9c3e600ca5","observation_id":"d810dc78-8e81-4d29-ba3c-9aadfc4826e6","resolution":{"observed_at":"2026-05-15T12:12:14.719985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-12T19:21:14.741696Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-18T09:00:36.136914Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T19:21:14.741696Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2411.10803"},"observation_digest":"sha256:009977ec9e228e744471c00acc1f4e46f3b5ba19efa26d58b72060c7c40f87af","observation_id":"c966751d-677d-4b39-983b-438a783cffc4","resolution":{"observed_at":"2026-08-12T19:21:14.741696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-12T18:35:54.632030Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11435","last_updated":"2025-08-02T07:00:49Z","snapshot_observed_at":"2026-08-15T02:37:32.825705Z","submitted_at":"2024-11-18T10:04:10Z","title":"GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:35:54.632030Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2411.11435"},"observation_digest":"sha256:782c8c6d63845611cb3dd4e654861d3c2c302b2e28a0f9344702c66b89555a88","observation_id":"0438530b-fe09-49ce-9cda-43a5c62b16d7","resolution":{"observed_at":"2026-08-12T18:35:54.632030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-12T12:25:00.383749Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17773","last_updated":"2024-12-02T14:55:49Z","snapshot_observed_at":"2026-08-15T21:31:19.542120Z","submitted_at":"2024-11-26T09:36:02Z","title":"Efficient Multi-modal Large Language Models via Visual Token Grouping","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:25:00.383749Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2411.17773"},"observation_digest":"sha256:203dde57be14bbd7a404ce2be18bb09722e1a7f14ad9c089e4c461cf7215f080","observation_id":"ae0cb8b0-25e8-4e56-a9ff-a24c72415139","resolution":{"observed_at":"2026-08-12T12:25:00.383749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-12T05:21:10.950068Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00556","last_updated":"2024-12-08T04:41:32Z","snapshot_observed_at":"2026-08-18T03:51:17.029774Z","submitted_at":"2024-11-30T18:54:32Z","title":"Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T05:21:10.950068Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2412.00556"},"observation_digest":"sha256:f98ea0c33b92b798f92cf70d93438a6d7404ace7c93be5245819d6f61f33b626","observation_id":"617773fb-162c-4e0b-b3b1-08ff1ad0a1d2","resolution":{"observed_at":"2026-08-12T05:21:10.950068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-12T04:35:37.020259Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01292","last_updated":"2025-02-02T11:49:25Z","snapshot_observed_at":"2026-08-18T06:32:16.050485Z","submitted_at":"2024-12-02T09:07:57Z","title":"LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:37.020259Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2412.01292"},"observation_digest":"sha256:d0e35cd45f212c603b02af0caf549d493c00d3e73ee1f3b8b9e0a10a675fd89a","observation_id":"6ba662bc-0477-4522-9029-b31ae0f3edb1","resolution":{"observed_at":"2026-08-12T04:35:37.020259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-11T23:54:23.816305Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02104","last_updated":"2024-12-03T02:54:31Z","snapshot_observed_at":"2026-08-16T12:56:12.864592Z","submitted_at":"2024-12-03T02:54:31Z","title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","version":1},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-08-11T23:54:23.816305Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2412.02104"},"observation_digest":"sha256:9cba3fed2f260e68d793f47521ed59a665ad48073dc6eb4b58a893891bb24e95","observation_id":"408278cd-8194-441e-a38b-e7fe1cb0525b","resolution":{"observed_at":"2026-08-11T23:54:23.816305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-11T21:31:44.581931Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04449","last_updated":"2025-08-06T16:57:39Z","snapshot_observed_at":"2026-08-14T02:35:33.601057Z","submitted_at":"2024-12-05T18:58:03Z","title":"p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:31:44.581931Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2412.04449"},"observation_digest":"sha256:4d11648431b77704277cc20a8633f648b83e07044356728f4fb0f65d4f2c3c66","observation_id":"0fdcfc80-347f-4846-9f37-4fa7749c7790","resolution":{"observed_at":"2026-08-11T21:31:44.581931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-11T20:23:18.709285Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05819","last_updated":"2024-12-08T05:29:39Z","snapshot_observed_at":"2026-08-14T23:05:28.608576Z","submitted_at":"2024-12-08T05:29:39Z","title":"[CLS] Token Tells Everything Needed for Training-free Efficient MLLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T20:23:18.709285Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2412.05819"},"observation_digest":"sha256:c61a122c209b21b760dfb3c8e191895e230d976ddae2ca8fe1d62257d995fd4b","observation_id":"984286a4-b366-405e-97c6-53abeeab1c45","resolution":{"observed_at":"2026-08-11T20:23:18.709285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-11T14:13:24.633703Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12359","last_updated":"2025-01-07T15:36:54Z","snapshot_observed_at":"2026-08-13T23:35:02.697596Z","submitted_at":"2024-12-16T21:14:11Z","title":"LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T14:13:24.633703Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2412.12359"},"observation_digest":"sha256:30477edbc06a1b207a58df3d010e831ca268d7f2bc177f1e94af9e18cac93328","observation_id":"f01fd9de-04df-43fa-a80f-72230581fecf","resolution":{"observed_at":"2026-08-11T14:13:24.633703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.20985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-07-04T16:39:57.301173Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":"72b8bcdd-c399-4415-a8e7-ca6f24d31b48","year":2024},"citing_paper":{"arxiv_id":"2412.18158","last_updated":"2026-05-18T03:47:22Z","snapshot_observed_at":"2026-08-01T18:44:32.302415Z","submitted_at":"2024-12-24T04:32:36Z","title":"Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-23T06:40:03.347536Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2412.18158"},"observation_digest":"sha256:3e518c7f2d1712a37e8fd1a2126180ded282de81ecceba36451de97151b2259d","observation_id":"38bb3028-34b6-4410-817b-fcce0b14bdd8","resolution":{"observed_at":"2026-05-23T06:42:39.606920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-10T23:39:18.191811Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20105","last_updated":"2024-12-28T10:17:29Z","snapshot_observed_at":"2026-08-17T05:06:38.097481Z","submitted_at":"2024-12-28T10:17:29Z","title":"ST$^3$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T23:39:18.191811Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2412.20105"},"observation_digest":"sha256:39d7e2c40a9db3ac292e6ee13c35780c59bb0f8dc1407ccb149691663d238676","observation_id":"f1bc009d-0f9d-49cf-b3c4-b52290c5536a","resolution":{"observed_at":"2026-08-10T23:39:18.191811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-10T22:20:45.869427Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02268","last_updated":"2025-01-04T12:14:42Z","snapshot_observed_at":"2026-08-14T14:50:18.945344Z","submitted_at":"2025-01-04T12:14:42Z","title":"What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T22:20:45.869427Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2501.02268"},"observation_digest":"sha256:10dcc471f24368f70449e747aad2071e81d6121decd01e44f445243b8819faaf","observation_id":"f1e66886-0670-4301-9502-412e138204d1","resolution":{"observed_at":"2026-08-10T22:20:45.869427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-10T13:38:18.870758Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.870758Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:8acf58fd7b4cd22e22adf1202b4528b34f7b59846531ad253f2803ea21263f4d","observation_id":"369d4a1a-0c92-4c72-b617-b8716adcf56d","resolution":{"observed_at":"2026-08-10T13:38:18.870758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-09T18:02:45.199090Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-17T12:12:27.599963Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.199090Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:6e314d3a576529fe26c9f8cfcafa429b49f1b05466102d9cfbc02acabf715826","observation_id":"af8a30b9-e676-481c-b2c3-9729c9a16f13","resolution":{"observed_at":"2026-08-09T18:02:45.199090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-16T10:47:27.417308Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17343","last_updated":"2025-04-24T07:59:46Z","snapshot_observed_at":"2026-08-17T17:03:49.803696Z","submitted_at":"2025-04-24T07:59:46Z","title":"TimeChat-Online: 80% Visual Tokens are Naturally Redundant in Streaming Videos","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T10:47:27.417308Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2504.17343"},"observation_digest":"sha256:a41ce4aa1b3ace69d8dadd999a40e431e20e682c4fc8bd1438c02d1a423305fc","observation_id":"15349772-bd33-4549-8eea-4463566cb1df","resolution":{"observed_at":"2026-08-16T10:47:27.417308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-16T10:46:21.296558Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17365","last_updated":"2025-04-29T01:53:09Z","snapshot_observed_at":"2026-08-18T18:05:51.406792Z","submitted_at":"2025-04-24T08:27:42Z","title":"TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T10:46:21.296558Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2504.17365"},"observation_digest":"sha256:27831d25e9debda50fc60c5852907c99a9e58f3a8ed1c6afed09be5439102477","observation_id":"374a7c16-2c10-4c62-aede-8ac0844045e3","resolution":{"observed_at":"2026-08-16T10:46:21.296558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-07T15:43:33.690880Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14043","last_updated":"2025-05-23T15:20:11Z","snapshot_observed_at":"2026-08-14T19:18:56.497684Z","submitted_at":"2025-05-20T07:39:27Z","title":"Selective Structured State Space for Multispectral-fused Small Target Detection","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:33.690880Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2505.14043"},"observation_digest":"sha256:a6cab455ad8cfaf40fce3c8d734c7a8bebabc1c614c313910b185d56226fd3a7","observation_id":"6efc93cf-a3aa-46b9-bd69-7d6eca2597cb","resolution":{"observed_at":"2026-08-07T15:43:33.690880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-07T00:49:53.341803Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12568","last_updated":"2025-06-14T16:52:04Z","snapshot_observed_at":"2026-08-18T14:46:10.953325Z","submitted_at":"2025-06-14T16:52:04Z","title":"MVP-CBM:Multi-layer Visual Preference-enhanced Concept Bottleneck Model for Explainable Medical Image Classification","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:49:53.341803Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2506.12568"},"observation_digest":"sha256:bf6afd8af48d269752463fbbaa9ee6900bed27cd0a84e015060e775831d3628f","observation_id":"460a044d-4ddb-431a-87f7-c0383263c933","resolution":{"observed_at":"2026-08-07T00:49:53.341803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T22:24:34.531441Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models.arXiv preprint arXiv:2405.20985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-13T09:08:08.645501Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:34.531441Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:bb7c552c50f256a697b4d103f37812cdfeb2ae593889093948bd622580e1f904","observation_id":"cf40e7ab-f15a-4d44-a5d0-db683303c096","resolution":{"observed_at":"2026-08-06T22:24:34.531441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T21:19:45.139225Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-15T20:28:40.863571Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.139225Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:b5dade7c7e6f87dc1f53735a89103d69139534d939ed72930fd92ed641efea2a","observation_id":"34b26c7e-af54-4113-a51c-b0978ddb19d5","resolution":{"observed_at":"2026-08-06T21:19:45.139225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T18:03:03.521866Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-15T18:44:58.192236Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.521866Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:bc28dfc481e15efafe153b1862b2c436094b3ab29b366c24b63cd2b3022055e0","observation_id":"710f3385-21c6-4bd4-b355-9f7a54843c1a","resolution":{"observed_at":"2026-08-06T18:03:03.521866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T17:38:18.564455Z","title":"arXiv:2405.20985 (2024) 3, 10","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-13T10:47:40.351375Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:18.564455Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:d4956f907bdfd5f3d0516b8418b66fa595cd2ecfd971e06bfd48492cc24ea268","observation_id":"7bf3ec7f-6b4a-4085-a110-40881a5299fd","resolution":{"observed_at":"2026-08-06T17:38:18.564455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T13:18:05.305866Z","title":"DeCo: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:05.305866Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:d377ceb0c8248c5788f002e07d310bb26b1ba25ae93db88604bc8bd48128e571","observation_id":"77bc4401-8c03-49ac-8110-7207b35e9308","resolution":{"observed_at":"2026-08-06T13:18:05.305866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T12:31:26.101813Z","title":"Deco: De- coupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-18T12:54:06.088881Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.101813Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:de88c439954911a12d79e1d46bbf9a4a862df1a3d57dbfc244d9e43b353c1455","observation_id":"755eb3ef-c83d-46cc-b854-83e06da943dc","resolution":{"observed_at":"2026-08-06T12:31:26.101813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-03T21:31:36.658213Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models.arXiv preprint arXiv:2405.20985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.15098","last_updated":"2026-06-21T15:38:16Z","snapshot_observed_at":"2026-08-14T07:24:20.183029Z","submitted_at":"2025-11-19T04:13:36Z","title":"A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T21:31:36.658213Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2511.15098"},"observation_digest":"sha256:d9556655822a89c55e6a7bac6c140268b422d419d12355c3c6bd455ac15e9db0","observation_id":"b2329731-d797-4304-98b5-da0f72ab09f4","resolution":{"observed_at":"2026-08-03T21:31:36.658213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.20985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-07-04T16:39:57.301173Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":"72b8bcdd-c399-4415-a8e7-ca6f24d31b48","year":2024},"citing_paper":{"arxiv_id":"2603.27383","last_updated":"2026-04-10T19:04:13Z","snapshot_observed_at":"2026-08-11T14:39:01.939262Z","submitted_at":"2026-03-28T19:29:38Z","title":"Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-14T22:17:47.203589Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2603.27383"},"observation_digest":"sha256:330be1e66de549b9842badc4228a250f6f73625c56083b62a9653271303f3fd4","observation_id":"df90ee04-6cd9-4fb3-83bd-b921dba7fa2a","resolution":{"observed_at":"2026-05-14T22:18:04.021759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.20985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-07-04T16:39:57.301173Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":"72b8bcdd-c399-4415-a8e7-ca6f24d31b48","year":2024},"citing_paper":{"arxiv_id":"2604.02689","last_updated":"2026-04-03T03:32:55Z","snapshot_observed_at":"2026-08-15T05:07:17.183164Z","submitted_at":"2026-04-03T03:32:55Z","title":"Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-13T19:45:33.950587Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2604.02689"},"observation_digest":"sha256:9a2a48423e3188744ace8f602d102a10b6564f93d4e32de662ed63947cabb611","observation_id":"c19ec3be-c4d6-4286-b181-ffde45c51c61","resolution":{"observed_at":"2026-05-13T19:48:11.412822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.20985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-07-04T16:39:57.301173Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":"72b8bcdd-c399-4415-a8e7-ca6f24d31b48","year":2024},"citing_paper":{"arxiv_id":"2604.11240","last_updated":"2026-08-07T07:55:15Z","snapshot_observed_at":"2026-08-15T19:42:32.677789Z","submitted_at":"2026-04-13T09:44:52Z","title":"Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T15:15:04.261855Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2604.11240"},"observation_digest":"sha256:9471b0d30d114f7c7e4f02598c498940c8660b22b4cb3d619e0e337d311e667e","observation_id":"4e7580aa-13f4-4d70-a71b-9a7ef1611c41","resolution":{"observed_at":"2026-05-11T10:56:05.685086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.20985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-07-04T16:39:57.301173Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":"72b8bcdd-c399-4415-a8e7-ca6f24d31b48","year":2024},"citing_paper":{"arxiv_id":"2604.22281","last_updated":"2026-04-24T06:51:58Z","snapshot_observed_at":"2026-07-06T23:08:42.301487Z","submitted_at":"2026-04-24T06:51:58Z","title":"DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T12:42:39.231468Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2604.22281"},"observation_digest":"sha256:11f04a444b99e49b2aac041575bb6a418009fe30ffb93643a07df0871918b44f","observation_id":"b82aa009-0379-4afd-bce0-8ca57ea4691f","resolution":{"observed_at":"2026-05-11T19:06:09.457346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.20985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-07-04T16:39:57.301173Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":"72b8bcdd-c399-4415-a8e7-ca6f24d31b48","year":2024},"citing_paper":{"arxiv_id":"2605.07568","last_updated":"2026-05-08T10:40:08Z","snapshot_observed_at":"2026-08-15T03:41:36.963506Z","submitted_at":"2026-05-08T10:40:08Z","title":"Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T03:04:27.841522Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2605.07568"},"observation_digest":"sha256:972a360b2d0b7e178b23fc948097517d86fc9104711618d9582dc7a99923bf5d","observation_id":"844e4f6e-4823-40a1-a518-eb41cd3a1ae4","resolution":{"observed_at":"2026-05-11T03:05:53.241879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.20985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-07-04T16:39:57.301173Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":"72b8bcdd-c399-4415-a8e7-ca6f24d31b48","year":2024},"citing_paper":{"arxiv_id":"2606.02300","last_updated":"2026-06-01T14:23:17Z","snapshot_observed_at":"2026-08-14T16:01:05.005608Z","submitted_at":"2026-06-01T14:23:17Z","title":"Beyond Isolated Behaviors: Hierarchical User Modeling for LLM Personalization","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-28T14:51:27.110839Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2606.02300"},"observation_digest":"sha256:ab9be5788a4122d68dd13fe636ff3891ed66f1c07eee8bc42577ab9b4a22e818","observation_id":"61894e26-eb2c-4b84-80b6-f84aa0e4fbff","resolution":{"observed_at":"2026-07-01T22:56:20.524251Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2405.20985","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-07-04T16:39:57.301173Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":"72b8bcdd-c399-4415-a8e7-ca6f24d31b48","year":2024},"citing_paper":{"arxiv_id":"2606.24422","last_updated":"2026-06-23T10:59:25Z","snapshot_observed_at":"2026-08-12T17:53:51.025868Z","submitted_at":"2026-06-23T10:59:25Z","title":"EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-26T00:26:33.306128Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2606.24422"},"observation_digest":"sha256:2af831a63eed9910976ac343eda45790ff196b7df0061a8b96a0b1a01f8271c5","observation_id":"11b4cc3e-125f-432b-95bc-bfc5029cc13d","resolution":{"observed_at":"2026-07-04T16:39:57.302618Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-01T11:44:11.253507Z","title":"arXiv preprint arXiv:2405.20985 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19816","last_updated":"2026-07-22T06:50:53Z","snapshot_observed_at":"2026-08-14T01:24:02.156587Z","submitted_at":"2026-07-22T06:50:53Z","title":"Hypothesis-and-Refinement Learning of Organic Structures from Multimodal Spectroscopic Data","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T11:44:11.253507Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2607.19816"},"observation_digest":"sha256:44e98d91e613607567fbd0d70e05cb81bf36223ff10a721cec4a63cfbb9d7c39","observation_id":"37f9eda6-418b-408d-aca4-af5ee0172385","resolution":{"observed_at":"2026-08-01T11:44:11.253507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-06T00:10:37.928101Z","title":"arXiv preprint arXiv:2405.20985 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01473","last_updated":"2026-08-02T20:09:45Z","snapshot_observed_at":"2026-08-15T11:04:31.557325Z","submitted_at":"2026-08-02T20:09:45Z","title":"Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs","version":1},"reference_index":252,"source":"arxiv_source","source_observed_at":"2026-08-06T00:10:37.928101Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2608.01473"},"observation_digest":"sha256:af8586faedf67454b1414c2b9396d84e05f896a4b72d1d47417dabe7aabc05b5","observation_id":"eb207b77-30e0-4010-b5a2-f83c0954cdd8","resolution":{"observed_at":"2026-08-06T00:10:37.928101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-15T14:33:15.022459Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07088","last_updated":"2026-08-07T10:39:47Z","snapshot_observed_at":"2026-08-18T12:07:35.306502Z","submitted_at":"2026-08-07T10:39:47Z","title":"RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T14:33:15.022459Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2608.07088"},"observation_digest":"sha256:4120e03d315213ddac40395c1ba144e8b23fca1a7d9b33c146ac3a886d11bd62","observation_id":"51912b01-be2c-42b6-850d-082518beb5fb","resolution":{"observed_at":"2026-08-15T14:33:15.022459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-12T11:55:37.141110Z","title":"DeCo: Decoupling token compression from semantic abstraction in multimodal large language models.arXiv preprint arXiv:2405.20985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11024","last_updated":"2026-08-11T15:05:18Z","snapshot_observed_at":"2026-08-17T20:00:07.271838Z","submitted_at":"2026-08-11T15:05:18Z","title":"When Visual Signals Mislead: A Mechanistic Study of Attribute Hallucination in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:55:37.141110Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2608.11024"},"observation_digest":"sha256:0475690e23abc98b23d145125bd1270885f870c01e438d3ab90a46e22b1325e1","observation_id":"be0d5add-b79f-46d7-8bc6-acd9d6456e87","resolution":{"observed_at":"2026-08-12T11:55:37.141110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-16T00:09:18.269408Z","title":"arXiv preprint arXiv:2405.20985 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12748","last_updated":"2026-08-13T02:57:21Z","snapshot_observed_at":"2026-08-18T14:54:50.007162Z","submitted_at":"2026-08-13T02:57:21Z","title":"Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T00:09:18.269408Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2608.12748"},"observation_digest":"sha256:37435e12eb434bad8f83ac9762d42656a3a14da9d08428e1016bb066b3b14e78","observation_id":"ff44c456-9f22-4a7d-8893-38d52e44efd7","resolution":{"observed_at":"2026-08-16T00:09:18.269408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.20985/citation-record","integrity":"/paper/2405.20985/integrity","json":"/paper/2405.20985/citation-record.json","paper":"/paper/2405.20985"},"outbound":[],"paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 39 inbound Pith citation observations for arXiv:2405.20985."}