{"as_of":"2026-08-13T14:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76af0723b33abfe872e262214afc830c9c9e9bbf104b8f56416429e560ef2f47","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:22:07.588062Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T11:13:49.266859Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:39:42.103464Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"cited_work":{"arxiv_id":"2411.15446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15446","snapshot_observed_at":"2026-07-04T08:39:42.103464Z","title":"freePruner: A training-free approach for large multi- modal model acceleration","venue":null,"work_id":"05bd33db-0bae-4456-ad38-2bc17f96e3bf","year":2024},"citing_paper":{"arxiv_id":"2605.17954","last_updated":"2026-05-18T07:09:46Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T07:09:46Z","title":"A More Word-like Image Tokenization for MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T12:46:04.946489Z"},"links":{"cited_paper":"/paper/2411.15446","citing_paper":"/paper/2605.17954"},"observation_digest":"sha256:78fe510b81affa72c2ef731a50502d6afd6f6db8a097dd708b748a2bd759a977","observation_id":"af2b5615-992a-4597-bd0f-402399485595","resolution":{"observed_at":"2026-05-20T12:48:17.444765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"cited_work":{"arxiv_id":"2411.15446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15446","snapshot_observed_at":"2026-07-04T08:39:42.103464Z","title":"freePruner: A training-free approach for large multi- modal model acceleration","venue":null,"work_id":"05bd33db-0bae-4456-ad38-2bc17f96e3bf","year":2024},"citing_paper":{"arxiv_id":"2606.22352","last_updated":"2026-06-21T06:20:55Z","snapshot_observed_at":"2026-08-06T05:50:18.958153Z","submitted_at":"2026-06-21T06:20:55Z","title":"On the Sparsity-Storage-Accuracy Tradeoff in Parsimoniously Activated Dictionary Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T11:13:49.266859Z"},"links":{"cited_paper":"/paper/2411.15446","citing_paper":"/paper/2606.22352"},"observation_digest":"sha256:b4127ec02b97c2c98a8251e84dbccd0896dbc9cdff51da7afce99e24bd413ebb","observation_id":"8e83e1cc-20c7-4665-b65b-deb88e81a0c5","resolution":{"observed_at":"2026-07-04T08:39:42.104955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15446/citation-record","integrity":"/paper/2411.15446/integrity","json":"/paper/2411.15446/citation-record.json","paper":"/paper/2411.15446"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.568301Z","title":null,"venue":null,"work_id":"d839d3c6-4567-49f3-a601-006898aa013a","year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.273546Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:e974f99acca77230343139bcbe9a05601cd33559d2da5e747af4b200af7cfc0c","observation_id":"0bf8cc7b-aef2-44f2-8218-fcf49d0fdabc","resolution":{"observed_at":"2026-08-12T14:22:08.571993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.556937Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"3e3af542-0126-40c6-b3b2-841d36451f87","year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.278165Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:2b7fda0e18efa0a4dde3ad8ad4ffd65290a7ee76c436b1ba51cb2edc3658f0d0","observation_id":"abdf8b63-4d22-460d-bcb1-b5c954637d88","resolution":{"observed_at":"2026-08-12T14:22:08.560911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-12T08:59:05.030983Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-12T14:22:07.282137Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.282137Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:73b9ff90e54e211ea6cd66304eaabcb31f31745f4d6be4dfc8c5dba8f5b14c8b","observation_id":"3d577f78-9146-49a3-aeae-4adfa1ab8f47","resolution":{"observed_at":"2026-08-12T14:22:07.282137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T14:22:07.286320Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.286320Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:8d090a7e764d8591d8728044687425634d3595d17e077726adad4e8457e4580f","observation_id":"0326bd57-e697-4c4b-bfe5-2104572df3e2","resolution":{"observed_at":"2026-08-12T14:22:07.286320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-12T14:22:07.290005Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.290005Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:13fd95ebfe122887aaf27fc851e25cb1c8055aefe0a240e239375c79d47b2861","observation_id":"b6db6cf9-786f-4ee5-a678-9d924c6bd95e","resolution":{"observed_at":"2026-08-12T14:22:07.290005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.545803Z","title":"Token merging: Your ViT but faster","venue":null,"work_id":"d7cc3f8f-c58a-4425-8cee-0531a508b37b","year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.294198Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:07e843b2ae7cf2c477457dce3afaf4950c57e97750bff9431aaf8dfc49d14cc2","observation_id":"ce2c7d07-4aca-4899-8e92-a11e61b24411","resolution":{"observed_at":"2026-08-12T14:22:08.549697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.536151Z","title":"Meyer, Yuning Chai, Dennis Park, and Yong Jae Lee","venue":null,"work_id":"7bd5ebb3-b28d-49ae-9060-ab5a869478c5","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.297933Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:799c1b07e81230dfb045785e6e7a7ff66f0512bd15af6cc9a6a9a2a9ab7c0e02","observation_id":"1c0a72b2-efe8-42ca-ad5b-f5f609303266","resolution":{"observed_at":"2026-08-12T14:22:08.539409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.526219Z","title":"Coarse-to-fine sparse transformer for hyperspectral image re- construction","venue":null,"work_id":"6810a2db-2cd8-41b6-a105-f004624b3ae8","year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.301786Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:9f7b54bc0681338e195979bae4695f7be120800bc691044ea959141aa0d3194f","observation_id":"64805e46-cd9c-4acb-baf9-689c2a0d3f80","resolution":{"observed_at":"2026-08-12T14:22:08.529873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-12T14:22:07.305202Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.305202Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:6856248f902f207e08420fbda411df90c135bcba65c034133bf1a55003b915dc","observation_id":"80399462-c7f5-468c-adc6-b63e847fe2c1","resolution":{"observed_at":"2026-08-12T14:22:07.305202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.308933Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.308933Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:d4c4458a719c2a68661fbd727ab0817bed203346c7e10948222d681af4304ca0","observation_id":"b68c2bbd-3911-4d4f-b479-955692a474c8","resolution":{"observed_at":"2026-08-12T14:22:07.308933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-12T14:22:07.312540Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.312540Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:ff194471b8c6813fed0165275cded73593a9dc8c1e1e7524b7f57b76b019f5ca","observation_id":"5ad0558b-07f1-4407-a7fc-a158750c5ae9","resolution":{"observed_at":"2026-08-12T14:22:07.312540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-12T14:22:07.316401Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.316401Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:6203313c4a62b0d3232df60bb01f2134b95c06a27b08962cd415250678d38cc8","observation_id":"e85f311e-11d9-4e87-a90e-63cb0bb8ba69","resolution":{"observed_at":"2026-08-12T14:22:07.316401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.320004Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.320004Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:d9825677405e64fca6a6543cc72e727fa403ef04d37377594cc58e0242485187","observation_id":"e3a5527c-b1a9-48e8-b98f-9df3918f72c7","resolution":{"observed_at":"2026-08-12T14:22:07.320004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.501839Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":"c555382a-e2b6-4698-ba9a-03b943a38eee","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.323609Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:88eabe52b0845b98c2bca79009b3957a80ce9d0e3b607c3f712aee424b0c6f4e","observation_id":"e5bcd0ac-4bc6-4fd6-8e20-3449357ecd1a","resolution":{"observed_at":"2026-08-12T14:22:08.505903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T14:22:07.327025Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.327025Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:353e2b6e5e8b41a58154e57a0cf20cac71d80ddca32047df069f3eaa7a605f2d","observation_id":"ee4ab44e-d5f6-4638-89ab-6e486774c4af","resolution":{"observed_at":"2026-08-12T14:22:07.327025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.490459Z","title":"Adaptive token sampling for efficient vision transformers","venue":null,"work_id":"7d178952-0a58-4eea-b7f3-afb7161e61ad","year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.330567Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:e893b527ef7f7cfe6d5d33b67140cd5eb0934b1a19c4aa50196c72cbdff6b4e4","observation_id":"ebf6327e-36bd-4bf9-82af-e35279d4fa7c","resolution":{"observed_at":"2026-08-12T14:22:08.494221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-12T14:22:07.334323Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.334323Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:47d18ae7462006fc443c808d072da12d22bac4544ae3d685ab98076aec9bb13e","observation_id":"183a75b9-1672-4838-9a7d-52bcb7aa8c99","resolution":{"observed_at":"2026-08-12T14:22:07.334323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T14:22:07.338146Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.338146Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:84fa70fd11f9188999f6ab015581e48e8f25e19a53b13aa9fd40d0c00940040f","observation_id":"6d24d7c2-f79c-4533-8b75-8c4fb9b88dac","resolution":{"observed_at":"2026-08-12T14:22:07.338146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08944","last_updated":"2024-05-14T20:17:22Z","snapshot_observed_at":"2026-08-13T00:07:39.901086Z","submitted_at":"2024-05-14T20:17:22Z","title":"Challenges in Deploying Long-Context Transformers: A Theoretical Peak Performance Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08944","snapshot_observed_at":"2026-08-12T14:22:07.341700Z","title":"Challenges in deploying long-context transform- ers: A theoretical peak performance analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.341700Z"},"links":{"cited_paper":"/paper/2405.08944","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:7c93a96d58de070ab45800e277b30836dc8e3e1f25ae67d35bbdbe40822905fe","observation_id":"1cda67c1-684a-4841-a613-afe8ad88f4e2","resolution":{"observed_at":"2026-08-12T14:22:07.341700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.345459Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.345459Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:2b39918983278cf32c2dd64fbe42c4150c15214727c2ab77757c8262a2031f61","observation_id":"36ae0581-7f6b-4d91-929c-9ba16718ecd4","resolution":{"observed_at":"2026-08-12T14:22:07.345459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.473936Z","title":"Which tokens to use? investi- gating token reduction in vision transformers","venue":null,"work_id":"0df36e83-7e6c-4d7a-953e-6390f42e70ec","year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.348907Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:f9e6d533c176d3b26938c745a377c94cf5c68ad5d61dbf5aa86631333980fffb","observation_id":"d82f2e2c-0521-45a0-a0a2-0489fb7499ae","resolution":{"observed_at":"2026-08-12T14:22:08.477789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.463264Z","title":"3d-llm: Inject- ing the 3d world into large language models.NeurIPS, 2023","venue":null,"work_id":"1fea988a-2d60-4446-9e92-af56d68273f0","year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.352351Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:fcf18b173d5d367cec9e232fff49c95e4171d87bf5d72507989cbce2df2c06b5","observation_id":"4684aa1d-a075-4eac-9431-a8866dde8d17","resolution":{"observed_at":"2026-08-12T14:22:08.467104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T14:22:07.355666Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.355666Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:f59816f3db6df09b84d480a098307051c7da2298b92118492e7913def277fdae","observation_id":"75edc326-98be-410d-9c02-c15bde83314b","resolution":{"observed_at":"2026-08-12T14:22:07.355666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.359703Z","title":"Efficient multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.359703Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:4f453edc12b3e194b443fe959ab4d2713e6869ccab5372965053977f4a710957","observation_id":"e1fd311e-914b-42da-8b66-56ef207a95a6","resolution":{"observed_at":"2026-08-12T14:22:07.359703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17863","last_updated":"2024-02-27T19:54:42Z","snapshot_observed_at":"2026-08-13T13:35:34.361478Z","submitted_at":"2024-02-27T19:54:42Z","title":"Vision Transformers with Natural Language Semantics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17863","snapshot_observed_at":"2026-08-12T14:22:07.371863Z","title":"Vision transformers with natural language seman- tics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.371863Z"},"links":{"cited_paper":"/paper/2402.17863","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:dc1d16f49d558c688694ba8060c9862732d06e1a9770b39d07f1a37e663621b6","observation_id":"f3abac6f-7a9f-43cb-ba93-79b754b0ce6b","resolution":{"observed_at":"2026-08-12T14:22:07.371863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T14:22:07.377105Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.377105Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:66e1d79c96850fe762d0cad8b742a1e796b9b7519c19a1c6a5d60321724d96f9","observation_id":"34b33b84-a249-4ac0-a9c2-68a84fab5ef4","resolution":{"observed_at":"2026-08-12T14:22:07.377105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.451943Z","title":null,"venue":null,"work_id":"fb3cd79f-883b-4a61-8b6b-b4414b1e3514","year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.381908Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:3c2e955fed19a11d5d9a7fda5aecafb11ab4df728ab3453867e8632ad011c5a5","observation_id":"a7ec506e-1364-4cb6-8fef-03a38b7bcf36","resolution":{"observed_at":"2026-08-12T14:22:08.456382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-12T23:30:17.473787Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-12T14:22:07.386710Z","title":"Tokenpacker: Effi- cient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.386710Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:1b4011a0a471e06e27635978a14aac1bde094f6245b230c5cd328ab8e36bf5d2","observation_id":"f0a986b0-1320-418f-be09-e018279d5e4d","resolution":{"observed_at":"2026-08-12T14:22:07.386710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-12T14:22:07.391779Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.391779Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:6ef46b28cdf4c00859979d24dc128b090cad7fd68e8016e99f98c1ed74e7b79a","observation_id":"b7a8f6f2-28be-4ff5-913a-f094ef0b19c6","resolution":{"observed_at":"2026-08-12T14:22:07.391779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-13T13:57:41.644520Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-12T14:22:07.396842Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.396842Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:4a1aade00a3991faa254e124e2c1bdb1c2fe2c9076fdd201c5e147d380146897","observation_id":"ea32277f-f74c-4b96-8501-641d1f696574","resolution":{"observed_at":"2026-08-12T14:22:07.396842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.440725Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":"a50939a5-1701-45b9-a126-8eaed63522af","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.401612Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:2bf45543c5189275fcfd8a3b13988285519452860ed2f5aa8124491f4c367c5b","observation_id":"4a8f3929-8780-4d8d-b9d2-7d3476037877","resolution":{"observed_at":"2026-08-12T14:22:08.444371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.406136Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.406136Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:7f8a53354709c0a7ce4dbb37e94b44f8f30934ba6cdea58d9d92a69c0b961f3b","observation_id":"09977cc5-f999-46c9-973b-344db8ac30ea","resolution":{"observed_at":"2026-08-12T14:22:07.406136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20210","last_updated":"2024-10-26T16:00:38Z","snapshot_observed_at":"2026-08-12T22:14:37.692924Z","submitted_at":"2024-10-26T16:00:38Z","title":"Looking Beyond The Top-1: Transformers Determine Top Tokens In Order","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20210","snapshot_observed_at":"2026-08-12T14:22:07.411170Z","title":"Looking beyond the top-1: Trans- formers determine top tokens in order","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.411170Z"},"links":{"cited_paper":"/paper/2410.20210","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:2b46743f0cebdb44d6c07ef87cd19bac7c3051e0b41e53d50f35725435d794d2","observation_id":"60435166-9c5d-4f04-ac31-c5c09e920dca","resolution":{"observed_at":"2026-08-12T14:22:07.411170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.416931Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.416931Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:beaafc7bd053e3538f222b1a882e9161d3d330a8632b7f975eb26b2d004579b3","observation_id":"91750a97-14ce-4536-8d10-d8cd33409556","resolution":{"observed_at":"2026-08-12T14:22:07.416931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.416169Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge","venue":null,"work_id":"9ab55076-0f46-4c84-8baa-90ec8b3a8fde","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.421398Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:ec82e6f1be676bbd51fd3046c6ed58324d1b0cb79300e24feab669d0c48b5d9f","observation_id":"53632313-9bfc-48bf-95fd-949d17e3e7e9","resolution":{"observed_at":"2026-08-12T14:22:08.420345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.405436Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"579b2c35-c4a9-4f8a-901f-da6ff7519974","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.426185Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:6b3baa6c2090a016c64c9134c41ca79a8eaddc027f2f46fe7ae8170f41b98ce9","observation_id":"fd7cb6c4-f436-4e49-bf67-9f11d1d33ef0","resolution":{"observed_at":"2026-08-12T14:22:08.409142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T14:22:07.430811Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.430811Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:e9d9d8cd549f716e8e40d00a09babbc4cbb3bd014a6422ac01ab3ee4856cca90","observation_id":"8c546c66-7c97-4723-9b46-d1a7ae3c17c9","resolution":{"observed_at":"2026-08-12T14:22:07.430811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-11T03:45:32.889856Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-12T14:22:07.435597Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.435597Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:201f04e8bdc90b272a929cea2b6e077165b22024ae83858bcec719b2d3af498a","observation_id":"615d776e-a0c8-4bba-ab72-cf6d543da630","resolution":{"observed_at":"2026-08-12T14:22:07.435597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13802","last_updated":"2023-07-06T10:49:33Z","snapshot_observed_at":"2026-08-13T14:18:02.587438Z","submitted_at":"2022-09-28T03:07:32Z","title":"Adaptive Sparse ViT: Towards Learnable Adaptive Token Pruning by Fully Exploiting Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13802","snapshot_observed_at":"2026-08-12T14:22:07.440191Z","title":"Adaptive sparse vit: Towards learnable adaptive token pruning by fully exploiting self-attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.440191Z"},"links":{"cited_paper":"/paper/2209.13802","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:98dd3899185d16a7c986c2b2d330aadd703cc95cd90c7b7b911482ac7ef14fb2","observation_id":"c4207409-16a7-4de0-a389-0ee3bb088653","resolution":{"observed_at":"2026-08-12T14:22:07.440191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-12T14:22:07.444846Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.444846Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:6fa49baa35381b33f223862458c93367fae2e2325a4d88e8277516e7efd73490","observation_id":"b89fd827-8ebf-46f7-953d-d92c22f8c340","resolution":{"observed_at":"2026-08-12T14:22:07.444846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.393435Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"95deb140-b79b-4591-a0cf-ab4c55556c60","year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.448657Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:155e091d44c6e0052056eb20dfe947b5d8ef7a22a8a0579163a40db2e4ae0337","observation_id":"8fb85cb8-4519-46d1-b5c8-e6cbb98f41e7","resolution":{"observed_at":"2026-08-12T14:22:08.398107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.382884Z","title":"Gpt-4 technical report","venue":null,"work_id":"093a0a09-c978-471c-8360-96d1afa75777","year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.453099Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:a80f9b45938d8bca1e4b01588bebd02d82ace820beb8e2931f6dbac0b24f4faa","observation_id":"52ab48fb-89c4-4c8a-ba26-2281ce1d11d2","resolution":{"observed_at":"2026-08-12T14:22:08.386542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.457058Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.457058Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:7b7712cd5b4bb5d8e6372cbfc68d5d54f86ba8a085971d55208f1c16d5f29434","observation_id":"3f8400f6-8ed3-4e29-bca1-5f87e93384ba","resolution":{"observed_at":"2026-08-12T14:22:07.457058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-12T14:22:07.462074Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.462074Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:bb32ab89ad3912bf260c269d871d7fb5f4296cdd31798c1290512dd584530a46","observation_id":"524a78d8-3900-4af5-af7e-a50431a87409","resolution":{"observed_at":"2026-08-12T14:22:07.462074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-08-13T01:33:21.194051Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-12T14:22:07.467056Z","title":"xgen-mm-vid (blip-3- video): You only need 32 tokens to represent a video even in vlms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.467056Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:a4d6fe29fdc4269bd64f99030d14411cba97cb9c61d7eb9defbea572185dcb4d","observation_id":"a636e3c2-b084-4079-94cd-9a3fa2de403d","resolution":{"observed_at":"2026-08-12T14:22:07.467056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.471159Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.471159Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:8b1b5958bfafd1d69eb5cf1ff971cd6870f995b97369cb46f83c8e9acf152258","observation_id":"4eb7ce5c-0b20-487b-aa28-f9ff26e1347d","resolution":{"observed_at":"2026-08-12T14:22:07.471159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.365082Z","title":"Enhancing post-training quantization calibration through contrastive learning","venue":null,"work_id":"cfee997f-0e8d-4939-8c86-c7d4df9abb9e","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.475258Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:4cfae83964533155acb3bd6ccc3622013091d1f825efa7dfbeb238e949b66179","observation_id":"b0c00712-cda3-47b7-8534-17468feb3153","resolution":{"observed_at":"2026-08-12T14:22:08.368904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12963","last_updated":"2024-10-02T01:56:08Z","snapshot_observed_at":"2026-08-12T22:41:32.284756Z","submitted_at":"2024-09-19T17:59:55Z","title":"Interpolating Video-LLMs: Toward Longer-sequence LMMs in a Training-free Manner","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12963","snapshot_observed_at":"2026-08-12T14:22:07.479797Z","title":"Interpolating video-llms: Toward longer- sequence lmms in a training-free manner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.479797Z"},"links":{"cited_paper":"/paper/2409.12963","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:e4844e92726fc9cd53b9a66b6443ee44d067f37d0730f7a6cdfa95df4fe4b9b1","observation_id":"aa91d93a-1bb4-4454-9e95-c751b41c9caa","resolution":{"observed_at":"2026-08-12T14:22:07.479797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00034","last_updated":"2023-11-07T20:41:22Z","snapshot_observed_at":"2026-08-13T10:02:10.987700Z","submitted_at":"2023-09-29T14:35:27Z","title":"PB-LLM: Partially Binarized Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00034","snapshot_observed_at":"2026-08-12T14:22:07.484737Z","title":"Pb-llm: Partially binarized large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.484737Z"},"links":{"cited_paper":"/paper/2310.00034","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:2a09c1eec0f68e311e966aec3fd5c6345f3c044f38cbcdcc6cd67df358f7b236","observation_id":"f64d4ffe-cee7-4430-8aab-148c89293e88","resolution":{"observed_at":"2026-08-12T14:22:07.484737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.353443Z","title":"Crossget: Cross-guided ensem- ble of tokens for accelerating vision-language transformers","venue":null,"work_id":"95aa66b7-ac1f-4ae0-b22c-93037f624961","year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.489713Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:f0e6c827191cdaa14a16ae664dc5416e58128df9d783dceff2e798c4123135ce","observation_id":"4be06d13-8e3d-4042-a2ab-11f695fe7a6b","resolution":{"observed_at":"2026-08-12T14:22:08.357511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.341901Z","title":"Towards vqa models that can read","venue":null,"work_id":"8b7aa397-69fc-4dfd-9450-c0ba1e55344f","year":2019},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.494014Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:43383259adf2d12bdb1a1bf06915605bee85137de31103478f6428976a22cc9f","observation_id":"86bf74f5-5ae9-4bb6-84c1-e72090c10f30","resolution":{"observed_at":"2026-08-12T14:22:08.345964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-12T14:22:07.498433Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.498433Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:06710eab92cbe83f354272e67f8e7569096873bb4bf6c1ea262ab29b7d80f8a9","observation_id":"f1611754-88d6-4d73-ae1f-864d6fad6ea6","resolution":{"observed_at":"2026-08-12T14:22:07.498433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.331378Z","title":"Efficient transformers: A survey","venue":null,"work_id":"11cfb2c1-13e1-484e-8f37-27c81f607de6","year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.503181Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:3a7a5ca45a7c5cb8117122b2134e27ccfda2820ff4a8cfac381584cbccd632df","observation_id":"75a6f077-4f62-4fa4-bb32-36853f06a15d","resolution":{"observed_at":"2026-08-12T14:22:08.334930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T14:22:07.509001Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.509001Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:63c1adaa3ce437082ea1db5aa87023286e4c56efb6a4b1fdacc47b3a34ca63e6","observation_id":"d1b0608a-d6e1-4d95-9fec-bf9567e0d07a","resolution":{"observed_at":"2026-08-12T14:22:07.509001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T14:22:07.513552Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.513552Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:3bea548a82701060b499fd5335e5497c89c06c554e70a07970ae496d981f7bf7","observation_id":"fa0a8102-e27e-4d51-8fa7-3ad160f8f6a8","resolution":{"observed_at":"2026-08-12T14:22:07.513552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.517792Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.517792Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:e5d4559e62495f8e09a4625df56fbc97b808e8c05353fd346ac9e767921105ff","observation_id":"63e2dfd5-3fb6-4f76-9cf8-358c8eef45ad","resolution":{"observed_at":"2026-08-12T14:22:07.517792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08119","last_updated":"2025-02-24T01:36:56Z","snapshot_observed_at":"2026-08-12T22:26:07.251909Z","submitted_at":"2024-10-10T17:02:48Z","title":"Q-VLM: Post-training Quantization for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08119","snapshot_observed_at":"2026-08-12T14:22:07.522594Z","title":"Q-vlm: Post-training quanti- zation for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.522594Z"},"links":{"cited_paper":"/paper/2410.08119","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:05ee2257efe191f5b18394bc30ec3513d28671603ed6949edf9501eb6a2152e7","observation_id":"4b6105b5-2fad-4e47-af70-bdfeb2fc0dc9","resolution":{"observed_at":"2026-08-12T14:22:07.522594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:07.527373Z","title":"Sclip: Rethinking self-attention for dense vision-language inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.527373Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:14edcecad0cedc7fb95c481e9fa521deeef70489990bdf44f31ef6a4ec67b15b","observation_id":"90e90d60-a74b-49a3-b008-ecc8afbc6032","resolution":{"observed_at":"2026-08-12T14:22:07.527373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T14:22:07.531733Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.531733Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:44db5f2daf7d171c49c5a0f98c489eb874f3aa1d5841b7847c6393957e0ea055","observation_id":"8001ab3f-1911-4190-a5e8-c82a24cfc92c","resolution":{"observed_at":"2026-08-12T14:22:07.531733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-12T14:22:07.541318Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.541318Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:efe7b22376a2f53f80a7b0e583d8190f1c465597cbb3ee05acd89f4e203ff06b","observation_id":"6af6ad4f-3ed4-4563-b721-2c04d2d9b6e5","resolution":{"observed_at":"2026-08-12T14:22:07.541318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.306293Z","title":"A-vit: Adaptive tokens for efficient vision transformer","venue":null,"work_id":"07fd63b0-b2a4-4cd6-8c29-4d6c5813a2fb","year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.545638Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:8f58875fdd2fb60479c4e041602931cbe776d40065309314606a5f4a3b105e4c","observation_id":"655dc8d9-985a-4d15-b725-3e93bb003e00","resolution":{"observed_at":"2026-08-12T14:22:08.310293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-12T14:22:07.549762Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.549762Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:069d5c4ea4fa899b796243f3966320f4f682b9d22b274e50b6d2fb66c12a4c87","observation_id":"672dcb6b-6388-4f48-a2e4-605474ccb604","resolution":{"observed_at":"2026-08-12T14:22:07.549762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-13T04:10:18.599255Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-12T14:22:07.553844Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.553844Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:28dbe756ac8f8e4de963a2c401a635fbadb277e9870441c878e4f7c150a7b46f","observation_id":"a482768a-b8b3-48bd-88d2-0c4eb5f6a86e","resolution":{"observed_at":"2026-08-12T14:22:07.553844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-13T04:35:22.207759Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-12T14:22:07.558219Z","title":"Mm-llms: Recent ad- vances in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.558219Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:8ccc76b0be478110a4a34c6d01193adea03d3095d4ff91b71f11659707ae8351","observation_id":"27dd53b5-5e3b-490d-a891-ba47f2466071","resolution":{"observed_at":"2026-08-12T14:22:07.558219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T14:22:07.561704Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.561704Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:4f13b508128a15907abc983179d2d8518b88bc9edc1854345775a94cf2e88c90","observation_id":"dcb90463-83c0-40a1-a7bd-ddf8b86cf343","resolution":{"observed_at":"2026-08-12T14:22:07.561704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14439","last_updated":"2024-07-19T16:11:15Z","snapshot_observed_at":"2026-08-12T23:18:31.345577Z","submitted_at":"2024-07-19T16:11:15Z","title":"Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14439","snapshot_observed_at":"2026-08-12T14:22:07.566043Z","title":"Token-level correlation-guided com- pression for efficient multimodal document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.566043Z"},"links":{"cited_paper":"/paper/2407.14439","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:0f19c225e96c61677e94e5790a91bacf1f4386d437fa2090e963df6681c88880","observation_id":"640e2fd8-87c2-4780-babe-e733c10aa0fb","resolution":{"observed_at":"2026-08-12T14:22:07.566043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-13T11:00:14.993256Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-12T14:22:07.570328Z","title":"Gpt4roi: In- struction tuning large language model on region-of-interest","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.570328Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:8ab7ca2620af3e857783363ebc3f1ffcaff6614dd46c48a4f5a2a4d3c1a599dc","observation_id":"abbd4e5a-9db2-4616-b8cb-943ca9ecc495","resolution":{"observed_at":"2026-08-12T14:22:07.570328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.295952Z","title":"Extract free dense labels from clip","venue":null,"work_id":"eac774bf-6e2f-40f6-bfa4-6d89c8c8b35a","year":2022},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.575011Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:e7dcaaa229b5a22621cf2edc3b5f9f18ae851010049d94fead734b54d3474850","observation_id":"ff96a273-4dd6-46a1-884a-a5cb555065ca","resolution":{"observed_at":"2026-08-12T14:22:08.299391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-12T14:22:07.579546Z","title":"Languagebind: Extending video-language pretrain- ing to n-modality by language-based semantic alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.579546Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:406d3906e261ad7f65317e10f34477c802b04b41083305ecde99ea75faaae1bf","observation_id":"9cee5ab1-1327-4570-8edc-b26e0b9bc1e1","resolution":{"observed_at":"2026-08-12T14:22:07.579546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T14:22:07.584148Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.584148Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:6e0906bce7008ebe772bd48a48eb427f82131e4d1fd0a492112080059832ecc4","observation_id":"18310075-e217-4b61-802f-b67a256a483a","resolution":{"observed_at":"2026-08-12T14:22:07.584148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:22:08.282610Z","title":"Orthogonal Method with Post-training Quan- tization on LLMs Table 4","venue":null,"work_id":"0af89754-2a05-47c9-a511-8359e749d351","year":null},"citing_paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T14:22:07.588062Z"},"links":{"citing_paper":"/paper/2411.15446"},"observation_digest":"sha256:6a96764dac4d001546acf350bd8d46304b9c5f51d2fd2d53ce90fd0da0ce6bac","observation_id":"7319a30e-4cb1-46fd-b9d8-a5e734dba8b9","resolution":{"observed_at":"2026-08-12T14:22:08.288171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15446","last_updated":"2024-11-23T04:25:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T21:52:29.981420Z","submitted_at":"2024-11-23T04:25:16Z","title":"freePruner: A Training-free Approach for Large Multimodal Model Acceleration"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 2 inbound Pith citation observations for arXiv:2411.15446."}