{"as_of":"2026-08-05T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef5bb7cecf36824b5b7d5dbb087894765a26a3cedd5c638d2bdd1b59d9d40d46","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T10:59:31.772378Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T12:39:57.398423Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-16T12:40:54.865986Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"cited_work":{"arxiv_id":"2506.01097","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","venue":"cs.CV","work_id":"ac96de17-142a-4f7f-957a-1cb0409d71f7","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-07-31T09:24:49.481740Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":165,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2506.01097","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:8087976396e88e322effb00d98ff9b1a8bb85791c5418748354f2b198a2d5fd7","observation_id":"bae3f6c3-5cdd-4409-b8f2-c31e6040e976","resolution":{"observed_at":"2026-05-16T12:40:54.867214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01097/citation-record","integrity":"/paper/2506.01097/integrity","json":"/paper/2506.01097/citation-record.json","paper":"/paper/2506.01097"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":"bbd24402-18ed-4376-981a-589910a7fade","year":2023},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:9cdec2a27e310b74cb94a1f273651b90b35f0ed1271f5741f5ef39a9b8cad0fe","observation_id":"c26d6faf-e54f-4511-974e-3daee6bb58b8","resolution":{"observed_at":"2026-05-19T11:03:02.792368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen-vl: A frontier large vision- language model with versatile abilities","venue":null,"work_id":"8e62db3f-0601-4689-b3db-5ba5ec50cc50","year":2023},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:602d99c084acddc8f735932bda5d5be6c6ff21fdb9184d5c5657b83e1ba1913e","observation_id":"463d9ccb-700d-4596-b93c-2951ae06dece","resolution":{"observed_at":"2026-05-19T11:03:02.781798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek LLM: scaling open- source language models with longtermism","venue":null,"work_id":"ef572118-c2b9-433a-8171-5c3f71510bce","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:998fa2d9f26fbfbf2ccbb7d6375e23ec1218462b3e9541b8431db61b20bd3679","observation_id":"a323e9bf-818f-4022-a267-0d28f2477c79","resolution":{"observed_at":"2026-05-19T11:03:02.758489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token merging: Your vit but faster","venue":null,"work_id":"9e4c2723-1441-4264-98b8-4793f8f2b27a","year":2023},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:fc1ebe577f7ec51551047ba96a46e974fddf35bed6e3806092756b38251fdef3","observation_id":"d0bb35c0-7361-4084-93c4-ec94a29beff8","resolution":{"observed_at":"2026-05-19T11:03:02.814716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, et al","venue":null,"work_id":"3d40e257-8fe4-4b73-b9e2-1806ee2f1b62","year":2020},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:bf353621b05c88196f0395cf9fceaf783f4838b0abf30a8333197e1c134e3cbd","observation_id":"ece57648-e3e0-4a50-b0f7-dc302d43fb59","resolution":{"observed_at":"2026-05-19T11:03:02.754726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generic attention-model explainability for interpreting bi-modal and encoder-decoder transformers","venue":null,"work_id":"f79586a9-cd65-4790-8d50-9cbc79a2e845","year":2021},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:95cf7f3be35a494a894611945f6ad4b953437b0bc05e84e94c50a4be0373cba1","observation_id":"6740cd9d-f69a-4f5b-8176-c8e17631b05e","resolution":{"observed_at":"2026-05-19T11:03:02.742900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer interpretability beyond attention visualization","venue":null,"work_id":"7d6fb7a0-cbaa-4fa5-8acc-4c24938065a5","year":2021},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:56d2d5d416f1e7a81e811e0e22e3b35d2670eef0cc982790feee5cfd0222774d","observation_id":"2cde2d05-9939-4d8a-9057-0ec4f26d4d11","resolution":{"observed_at":"2026-05-19T11:03:02.826915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"07174283-5509-4c35-8537-05acdcbe6155","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:f2b25c8e5976e47897ee91d762babf46c4ecd6ddf24704552dc2ceb7e83091cd","observation_id":"4e0f0848-5fc8-4fb4-8234-529094968439","resolution":{"observed_at":"2026-05-19T11:03:02.788918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are we on the right way for evaluating large vision-language models? In NeurIPS","venue":null,"work_id":"8deffbca-b843-41ee-8f09-eb19c6b43920","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:b5b2c3dcc86fc44e6036c34ace14d2b917bd5041beb7aeaf3971a2888d0a976e","observation_id":"b5bdd3da-90c3-4771-9a40-c63b2eb27b24","resolution":{"observed_at":"2026-05-19T11:03:02.752110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":"5db852ae-30c4-4966-80d6-df6f617223da","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:b3bd25250600fd0d801319d2d15bf6454647aa275075bdc8c59dfa097caa25fa","observation_id":"f7e59611-31b1-449d-98fa-affd21fb87f2","resolution":{"observed_at":"2026-05-19T11:03:02.794180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"66434281-e485-4a1f-9a64-896cda2da88b","year":2023},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:034e20f1c80c23f9ef88fcda156d22b86634e5213802efd2707432d34e60cef3","observation_id":"0e328d32-f596-44a6-81e3-e5f416e4ba38","resolution":{"observed_at":"2026-05-19T11:03:02.796017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xception: Deep learning with depthwise separable convolutions","venue":null,"work_id":"c35e9e07-0984-46c8-90c2-b3ea2862238a","year":2017},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:0f7cf6ca9668f1c586e758b3c5e8933d462ff887fb5b8e085c3c6bf4559b974b","observation_id":"00612136-5f73-457e-aa88-91a2678a5f67","resolution":{"observed_at":"2026-05-19T11:03:02.785921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fu, Stefano Ermon, Atri Rudra, et al","venue":null,"work_id":"11947076-b1ce-45ac-8398-f3324662e63e","year":2022},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:621aeb3e6d94e710b5c5f1b62d4aa770ee7f2bfa568129b5288944f36c1c2179","observation_id":"2d765c91-b966-4ecd-8915-1aa63d15f7f4","resolution":{"observed_at":"2026-05-19T11:03:02.783782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"ef2d4be1-6f44-4998-9af3-794758561bb8","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:08e301d692596a322bf42e060971d66031218b035b09f2b4a07170aefa3dfa7f","observation_id":"0cb89053-8c1b-45be-9d08-ac9d3ab4c87f","resolution":{"observed_at":"2026-05-19T11:03:02.797439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding","venue":null,"work_id":"01a915d5-4856-41ef-a664-56e123e8762a","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:8295a64b77918f817a8c1920940170413a8ade2bff07800ab9b1e47aa4683f6e","observation_id":"d9895cb2-3f3b-4a1a-987f-374f3390de16","resolution":{"observed_at":"2026-05-19T11:03:02.795616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":"3d95ada3-64f4-46fe-a781-272c265fa593","year":2023},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:73150e2141759f786799c7bbd16831cf6bdb8e124f12205ae0b2bbfc706edbe9","observation_id":"fb67f627-4052-42aa-8d68-6ddff2000fa0","resolution":{"observed_at":"2026-05-19T11:03:02.764808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"860c415d-d13e-4297-8e89-e2ab830f2142","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:664e9e7bf49c78aee4544a1495ae094e84e6b0af11096cebdc0eb664cf7c89cf","observation_id":"ad3832a9-14a1-4c00-bc25-7233fbdacf92","resolution":{"observed_at":"2026-05-19T11:03:02.761076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploiting behavioral consistence for universal user representation","venue":null,"work_id":"12ca8fd7-0ac8-4136-a728-9a6587e44835","year":2021},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:6127e94c990f41b086511fba366fef8a447bcceb3164ae1a8083936638f5e2f4","observation_id":"e51329c3-b83b-41a7-8c10-4ef82f5c4412","resolution":{"observed_at":"2026-05-19T11:03:02.799856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infinity-mm: Scaling multimodal performance with large-scale and high-quality instruction data","venue":null,"work_id":"b7181e64-fe84-4f1a-a601-fe49fc7de675","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:ab5fecc1e53312add57fe8429877cdb315e22db09e6c4a6f9df2082cd68d9763","observation_id":"8970b9f6-7091-4178-85b3-16e6b834d9d9","resolution":{"observed_at":"2026-05-19T11:03:02.801323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prunevid: Visual token pruning for efficient video large language models","venue":null,"work_id":"a5040cd0-e9bd-4604-84e1-e1cd3acbc211","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:4c0a0b36635d7300b8546e6143a2c35d6a630ed463d705c196eaced983301544","observation_id":"690c090c-ba6e-440c-8ce0-b47c12d64d2d","resolution":{"observed_at":"2026-05-19T11:03:02.781537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"2fac408a-26f4-48df-afbd-7c471c290e6c","year":2015},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:54aad07070b69fc8cb2ebc1a07a3c48e200b7dce79cd975eb0dafe569685c608","observation_id":"f8cbbb8b-cd20-4d4a-801f-31034972905c","resolution":{"observed_at":"2026-05-19T11:03:02.812538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":"d94e513e-345c-4584-a037-ab87cb350be0","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:38f52c9c27b21218ce52a4ef8235634f775b91ec67639bd40bbf067bd4149eb8","observation_id":"b6608df9-224a-4c09-81ee-708bb4512b43","resolution":{"observed_at":"2026-05-19T11:03:02.807554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":"cea2e1af-15e7-47a2-a133-bf34b7a3c94f","year":2023},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:2f00fa3fe81bb0256658f504d4b7212840c78b511d67e1587bac938ef0762b7f","observation_id":"cbd1a489-469f-4add-8b0c-db3ab4be9a2a","resolution":{"observed_at":"2026-05-19T11:03:02.790507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3734d2fa-c468-4a0f-be75-48afec49c250","year":2023},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:d0e755b559635c63d4912179b102a882c2ad0607c1afa3dc704da5f4d1b60503","observation_id":"1af1265d-7bdd-44f0-b884-71b1a87b5de1","resolution":{"observed_at":"2026-05-19T11:03:02.793888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"53644cf7-6e8e-42ef-9fa0-0b3207654a87","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:26f65b0784c6f1a5659e7e34dace582a182e70f8a4b878ea1228648e4c1a686c","observation_id":"cd308669-d817-4768-bd6a-aaed0e7405d7","resolution":{"observed_at":"2026-05-19T11:03:02.806751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"eabdac17-f90a-4148-ab61-dc019edef6b1","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:0156cc39d79b031f4d8b0a920a2a3b009c5bc4d44e79a655ecfd4230debcadb3","observation_id":"f7ac3d09-63c1-4b81-b858-728cf3317b29","resolution":{"observed_at":"2026-05-19T11:03:02.768182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"979cb4ea-b907-422f-9b85-f4fb40bc5eed","year":2023},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:a9472d781bdc372cb1b3a3e1552a89f60a12d0bb032385aa36fa8b2fa6bd8f4b","observation_id":"f6346074-1edd-4d08-b476-0a4ab9f6f317","resolution":{"observed_at":"2026-05-19T11:03:02.753035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NVILA: efficient frontier visual language models","venue":null,"work_id":"211f1498-c4bd-4cd9-a81b-1b390cc5ee80","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:b431fee7cd4475bc3d31a04026e3fa6259884ebece7bcb3a44f858cd7a939349","observation_id":"6813d43a-fa9b-47e9-aec5-6827d169e46a","resolution":{"observed_at":"2026-05-19T11:03:02.822153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-4 technical report","venue":null,"work_id":"d4765516-964d-44bc-937c-02876c1a6e87","year":2023},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:9fe64bc4acdcde6dc8a15327c8d725d021f2051d9ffb2a6bfb259805f64be9b2","observation_id":"58415689-e9a5-4df8-b349-afac520ab9de","resolution":{"observed_at":"2026-05-19T11:03:02.779785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instruction tuning with GPT-4","venue":null,"work_id":"3e17d90d-cf8d-49e0-b0cc-caf63953d6df","year":2023},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:775127cc9e89bccf8da2c4d78e77067b9551d61c0f15250a365e8dbbee5a817f","observation_id":"2990951d-f910-48b0-ba3e-91b1fc4af379","resolution":{"observed_at":"2026-05-19T11:03:02.772214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":"f7411d1f-1e08-4538-b3d2-637ac14ced56","year":2023},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:64fa8c4204a856fcb6e6638093555cf3da3b71a4de3c2aca993d9f882d9cc0ba","observation_id":"77d09e1f-76d6-41f2-beaa-6dc1859e6f94","resolution":{"observed_at":"2026-05-19T11:03:02.773174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fastvid: Dynamic density pruning for fast video large language models","venue":null,"work_id":"0472f5e9-efca-44f9-a2c0-e1b669389e0d","year":2025},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:19c547a4403b0855387db2123677a4ae7b4f8b8d579c3e75949029db7073f68b","observation_id":"c9b3ba46-07eb-4746-8fa7-5492e1d8c84c","resolution":{"observed_at":"2026-05-19T11:03:02.766521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tempme: Video temporal token merging for efficient text-video retrieval","venue":null,"work_id":"fcc5928b-98a0-4a76-89d4-64b17b2cf387","year":2025},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:78e970da2624c18d81ccfb3a4b6f5e8de08e90fdabcc12d3b058863873531b7a","observation_id":"15270be9-8b46-4eca-9e6b-583616f5ac96","resolution":{"observed_at":"2026-05-19T11:03:02.776491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tokencarve: Information-preserving visual token compression in multimodal large language models","venue":null,"work_id":"21e5c4a9-3e92-4e5b-99a5-3e1661b85c48","year":2025},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:671c20c04d90f0c307ca6b8c0fd6c87e209fc488f7298a602a7a8eb74fbb29a6","observation_id":"8616e710-937f-46e3-8e98-0089ceeff31d","resolution":{"observed_at":"2026-05-19T11:03:02.778158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":"9655e3cf-56e8-4cc0-b641-833d25e93b6f","year":2023},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:d35354baef06cf76cb73bc02928564427b3c3adf421d8488824df93747973835","observation_id":"aaf2ffd8-0043-444a-b009-c2b428ab7e78","resolution":{"observed_at":"2026-05-19T11:03:02.785219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analyzing multi-head self- attention: Specialized heads do the heavy lifting, the rest can be pruned","venue":null,"work_id":"4281a745-a4bd-40f4-9eeb-7d0e2de018fb","year":2019},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:587cc5d84263b66c384537379aa0b7eaf594c7ac7d21c913740b941c780c7d8a","observation_id":"5e16955e-c6c4-41f6-b026-883d180d7eba","resolution":{"observed_at":"2026-05-19T11:03:02.745696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FOLDER: accelerating multi-modal large language models with enhanced performance","venue":null,"work_id":"ed8ed497-e175-4d77-87a2-68c07fb6b673","year":2025},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:36f8c91efb9f169c8f3fb80a908b0d52fb166c0e91449fb33db04650efc219fb","observation_id":"ec626fb4-423c-4056-962c-dd5c4d03d1e4","resolution":{"observed_at":"2026-05-19T11:03:02.759247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic-vlm: Simple dynamic visual token compression for videollm","venue":null,"work_id":"ecfbc18e-4007-4e16-98cc-423e57c3f288","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:d370d198634b0987405fa4e41371974bde85ca1dbe48fac4d1d8fe9f7adb63a0","observation_id":"6559ec26-13b8-4cc5-869f-0cfff9678a56","resolution":{"observed_at":"2026-05-19T11:03:02.810944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":"9be936d9-df37-43c6-b9e5-9e3703e97d43","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:7f7413ad59dfe4ba91ebe6b5c35048fe6fb162296ad8c7578f6bfabcbffbcc61","observation_id":"c99d1974-4863-417c-ab43-8b7d91e57182","resolution":{"observed_at":"2026-05-19T11:03:02.799208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":"36c595c8-7b09-4303-8524-9eeb1db5393f","year":2021},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:bf1846cc689a6eb3ad0accd59ec29f59f6c1a50616a06dbde4a821d84ed63e82","observation_id":"022417ea-8118-44a6-ab5a-03354d0ef972","resolution":{"observed_at":"2026-05-19T11:03:02.764600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction","venue":null,"work_id":"38e66f15-328d-4841-93d7-538ee18efb7c","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:2f2f5b0f8bf960fcf96e6e62883ea060718e69c7db7305ac626531cbcac0ca63","observation_id":"2c7549e5-d1c8-4840-b59d-da3afa6246b8","resolution":{"observed_at":"2026-05-19T11:03:02.750211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":"b4f3afa5-82c0-4bd5-84cb-d66e82bd1868","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:c63d0c9dd8729a2b9e7fd79b932151513bb99e3160b7f05dd5b1f13d95a68732","observation_id":"d49da3a2-9929-4bc0-8305-10911d2105fd","resolution":{"observed_at":"2026-05-19T11:03:02.819923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":"c428afe6-d4ed-477c-8c9b-fa9a2a7dd59e","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:0122ff30bdd19373b72e9abe37d3226129ef16391ec70fb58d309e07dec30ad0","observation_id":"58662a3c-35b6-426f-bef0-7298ac8cd680","resolution":{"observed_at":"2026-05-19T11:03:02.792193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":"9e3b4713-3654-4627-8d82-3d29bc5a8c23","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:e96d1d047f0e68ab84f25aa4d867f59b3fbb312a55c8fa4ee8a478bc21490607","observation_id":"b58b009b-4828-49c0-a284-4a3254153a1f","resolution":{"observed_at":"2026-05-19T11:03:02.748335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"d5928116-39fb-4eab-a8ba-fcefea375381","year":2019},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:90e6c670d79291a8ccbe6e2bc89627eaa2d54be7d2514e864895fdb85e0ee08e","observation_id":"3ee5a0b4-d8ce-4390-91fd-54dd017d4d72","resolution":{"observed_at":"2026-05-19T11:03:02.786937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual input and output","venue":null,"work_id":"53053641-cd20-4aec-9f21-4e77d8fbf3a1","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:f1a951f453c6b248eb42dc6789dac85c99a0e3b94aabd78b30ce4f96da7cab52","observation_id":"4567bb8e-21c6-422a-ac61-a76ed20c83cb","resolution":{"observed_at":"2026-05-19T11:03:02.747425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparsevlm: Visual token sparsification for efficient vision-language model inference","venue":null,"work_id":"0ea8eb2e-338c-418c-b908-84818f5b78a7","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:eed05da418eb60fd2d531dc474e90afbf188d242de4d040ccaa50b48b2b237a6","observation_id":"54c26a27-b30f-47ac-8406-54c80c763bb4","resolution":{"observed_at":"2026-05-19T11:03:02.817470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":"00575d87-28c9-432f-b36c-fb7cd062128d","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:4b616a5d877f02fcd31c524c736d04299d0fe9c4a3a34c866499b8812cae1638","observation_id":"50f7d372-fe02-4c2b-8dc2-4f14dbe6c130","resolution":{"observed_at":"2026-05-19T11:03:02.774821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A stitch in time saves nine: Small VLM is a precise guidance for accelerating large vlms","venue":null,"work_id":"0d5b42fb-d94f-4af5-9691-63f9ee67d80f","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:bcaf2497027c6e4f08a2ffd6ee0b24b08b6c13b0bb92a0f2cbebd7fa4b306ba9","observation_id":"93308d3c-b335-4ceb-a3c3-f9bc2230dbf2","resolution":{"observed_at":"2026-05-19T11:03:02.824360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"5705c7cb-282c-4d0d-a59e-d265518c45fc","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:852b40740ee023dd8883761a0a7f41322c8866ca2d1006c52d61a92ad67a714e","observation_id":"0f6733d5-8ba6-46b7-9af9-0c0bc74f516f","resolution":{"observed_at":"2026-05-19T11:03:02.808694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Focusllava: A coarse-to-fine approach for efficient and effective visual token compression","venue":null,"work_id":"64e5f8e3-a8dc-4c23-ae87-a12a0240c37a","year":2024},"citing_paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T10:59:31.772378Z"},"links":{"citing_paper":"/paper/2506.01097"},"observation_digest":"sha256:2f97989e96107ad795119c5d11241e822901b0d182ecf897bbec3b1d39d2d769","observation_id":"a3835aac-8831-463a-911d-3c2293451c7f","resolution":{"observed_at":"2026-05-19T11:03:02.814781Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01097","last_updated":"2026-05-03T16:55:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T21:34:38.683177Z","submitted_at":"2025-06-01T17:44:16Z","title":"Task-Related Token Compression in Multimodal Large Language Models from an Explainability Perspective"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":0,"verified_fuzzy":49},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2506.01097."}