{"as_of":"2026-08-08T22:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:514ad8a6ceccca786be6cda1dc609d71cf14793d51325b7129cda44b91450f24","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:56.294364Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:44:37.884895Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T08:11:02.504431Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14260","snapshot_observed_at":"2026-08-02T23:44:37.884895Z","title":"arXiv preprint arXiv:2505.14260 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12957","last_updated":"2026-06-29T06:43:50Z","snapshot_observed_at":"2026-08-04T00:07:49.527953Z","submitted_at":"2026-02-13T14:22:10Z","title":"HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T23:44:37.884895Z"},"links":{"cited_paper":"/paper/2505.14260","citing_paper":"/paper/2602.12957"},"observation_digest":"sha256:cad86454d14da670613f2a9b9102a645420a755d78c443c197fa55a333d71286","observation_id":"d950a3a3-52f9-4710-9137-a53eeb6e7b30","resolution":{"observed_at":"2026-08-02T23:44:37.884895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14260","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Speculative decoding reimagined for multimodal large language models.arXiv preprint arXiv:2505.14260, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2505.14260","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:b3f868f804114d2da1eb94e58e07e281c4797bfdd7019a56fd4af2d67a395065","observation_id":"8ef8e9bd-1a19-4d4c-a9c4-16e926bbd613","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.14260","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14260","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.14260 (2025)","venue":null,"work_id":"5c9b5923-8857-4616-9141-9e1d583c92ec","year":2025},"citing_paper":{"arxiv_id":"2604.09731","last_updated":"2026-06-30T01:27:13Z","snapshot_observed_at":"2026-08-06T01:39:37.713323Z","submitted_at":"2026-04-09T13:17:56Z","title":"SMART: When is it Actually Worth Expanding a Speculative Tree?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:47:57.421156Z"},"links":{"cited_paper":"/paper/2505.14260","citing_paper":"/paper/2604.09731"},"observation_digest":"sha256:2d2c46b6c741c79175f364b2b921b0e7bd8d98c3bcec916e1811cc6e54e89aaf","observation_id":"2212655e-0e7c-4a7f-b6d1-3393eb50a814","resolution":{"observed_at":"2026-05-11T08:11:02.508599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14260","snapshot_observed_at":"2026-08-02T01:48:52.479619Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14557","last_updated":"2026-07-16T04:37:02Z","snapshot_observed_at":"2026-08-07T01:49:31.068808Z","submitted_at":"2026-07-16T04:37:02Z","title":"Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T01:48:52.479619Z"},"links":{"cited_paper":"/paper/2505.14260","citing_paper":"/paper/2607.14557"},"observation_digest":"sha256:6b2dcd0b4a4e19a87b09266174138a8228fafd94c6e98eb1897a022ff60d6868","observation_id":"a35dae9a-87f5-42d7-8f24-55aeac61e1b2","resolution":{"observed_at":"2026-08-02T01:48:52.479619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14260/citation-record","integrity":"/paper/2505.14260/integrity","json":"/paper/2505.14260/citation-record.json","paper":"/paper/2505.14260"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.526818Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":"7fafd948-c362-4ab6-ab83-b9f0b68b29db","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.002187Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:7a4da7b69bfee9846695f8bbb0a4d5487370d0ff6df4a37a45cb8858b5f9b9b1","observation_id":"2dd385fe-9b0d-445d-b8f1-cc68bc70f85e","resolution":{"observed_at":"2026-08-07T15:43:05.607827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.294739Z","title":"Sharegpt","venue":null,"work_id":"4c2a5e61-b90c-411a-b6d1-9d488e8544f5","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.078322Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:d2d9e5d38aa41d89465ce7c7194bbdcd6ca5f494646a5117e53bfd2e37341bcb","observation_id":"7f67eed2-59f5-48e5-991c-cd46b061895c","resolution":{"observed_at":"2026-08-07T15:43:05.438602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.026981Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond, 2023","venue":null,"work_id":"2868ec9b-2f8c-41f4-8f5b-c45c67e4baf9","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.179436Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:5e2824fd98586860dab0ffc5c192104f00a3b2eb860c087f8f70748b91d47aea","observation_id":"e6927f43-8e81-4274-8bf4-258444046e7f","resolution":{"observed_at":"2026-08-07T15:43:05.149539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.850613Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":"49184fb4-9714-493c-811a-28b37203bf61","year":2025},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.248582Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:b08b60f9c6d9b2c878845c7fdb9fc84483979ed8dc7a8c00872b7d21b627a0b1","observation_id":"965a96a4-3d00-4de6-ab69-719b76398cba","resolution":{"observed_at":"2026-08-07T15:43:04.929426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.564454Z","title":"Lee, Deming Chen, and Tri Dao","venue":null,"work_id":"fef85c27-680b-41be-b2be-71b28c31357d","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.378487Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:5f7d224c04e0a341f81f2d16f70e275cf9704d47fc343faac47f1b15167afff2","observation_id":"8a5d4887-01d3-4a29-a57d-195b85dab7ac","resolution":{"observed_at":"2026-08-07T15:43:04.679671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.396553Z","title":"Madtp: Multimodal alignment-guided dynamic token pruning for accelerating vision-language transformer","venue":null,"work_id":"d65b0970-862c-435e-b13c-84d492130a10","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.477020Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:14e1d233bb9979ee5a4c0c2378b5ba590afc3f4ac683c0dc1505131d6adfdd55","observation_id":"eb9916d6-7160-437e-ab3b-039bc1341d38","resolution":{"observed_at":"2026-08-07T15:43:04.486357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11049","last_updated":"2025-04-02T01:58:38Z","snapshot_observed_at":"2026-08-08T01:17:07.764692Z","submitted_at":"2024-08-20T17:57:31Z","title":"MagicDec: Breaking the Latency-Throughput Tradeoff for Long Context Generation with Speculative Decoding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11049","snapshot_observed_at":"2026-08-07T15:42:51.603894Z","title":"Magicdec: Breaking the latency-throughput tradeoff for long context generation with speculative decoding.arXiv preprint arXiv:2408.11049, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.603894Z"},"links":{"cited_paper":"/paper/2408.11049","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:6b66797fe800aae69a5eb1a3d1efcda1a4c70e2e55bf1bf3ce8368545de9ee3e","observation_id":"2f28a232-067d-40cb-b824-62a0df9bdbc0","resolution":{"observed_at":"2026-08-07T15:42:51.603894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.216812Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"78111d38-bed8-409c-b57d-67fca085173d","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.758861Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:1a192f1408e607ea61173856e6498c650376359309e5b4f7e3cdec788e86b5f8","observation_id":"d2cb13a1-3cfb-4125-9508-c2cb4afd6868","resolution":{"observed_at":"2026-08-07T15:43:04.308827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.973855Z","title":"Diffrate : Differentiable compression rate for efficient vision transformers","venue":null,"work_id":"435551b1-85d9-4804-8750-9dd87b51cfc1","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.856526Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:0e53595bc1de2455fcce256961f2bd4a4557d77a489247589642f9e1a3cd1784","observation_id":"8472b815-8778-4719-b53a-e657fa0b0a88","resolution":{"observed_at":"2026-08-07T15:43:04.090731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T15:42:51.998002Z","title":"Evalu- ating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:51.998002Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:4209de53fa9a73b0e377a0c14e7fb919d51e1dfd652addac563a83e0252c45de","observation_id":"5971ae9b-2c20-4fff-85ce-4694e2f964cf","resolution":{"observed_at":"2026-08-07T15:42:51.998002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T15:42:52.140080Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.140080Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:98dc1f8508978e72addf0013534b411029b39883167172f15e93d63ab44feebf","observation_id":"cc6f647b-2343-4021-b403-87dbb174dd76","resolution":{"observed_at":"2026-08-07T15:42:52.140080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:52.269586Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.269586Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:d5d36e6827f846e3cd8bc101f079b272298edf2fa3f6c39adfac6104f917a929","observation_id":"a1a6d5c4-a8c2-4b6b-a810-159e414f5e6d","resolution":{"observed_at":"2026-08-07T15:42:52.269586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:42:52.384747Z","title":"Train- ing verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.384747Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:0cac9fad25bda023ff5a351de456e6528b61dc8eb3a1313f436673be967e6876","observation_id":"35311bcf-9417-48ea-8de5-2a63cfc3d0a1","resolution":{"observed_at":"2026-08-07T15:42:52.384747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.809460Z","title":"Flashattention-2: Faster attention with better paral- lelism and work partitioning","venue":null,"work_id":"c5611a66-b749-47bb-bd3b-f31a65d0a51a","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.520459Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:d5c03c0fe7905d5b4190d0b6e8441433bfafac9cc4c2c7861df8c8e732010154","observation_id":"607f0ff6-625e-4e48-b6a0-4c393f4a9d1d","resolution":{"observed_at":"2026-08-07T15:43:03.902246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.521662Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"060f8e02-0bb4-4e1e-9a3b-9865fb91d1ed","year":2022},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.654998Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:9b8fc4f64ba796f35b7da574263ff3151b78fd2ad6d66ad22fa4d10f709fbac6","observation_id":"2cca68c7-34f7-4400-a9b6-cb1ffa537e3d","resolution":{"observed_at":"2026-08-07T15:43:03.688863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.359595Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2023","venue":null,"work_id":"1db6db4b-0965-4b83-b97b-7420c947de32","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.766877Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:5665c5593ae5695db65741afcb2c093947c582b9708db1ecd1f489081c1c9003","observation_id":"46f9dfcc-1f41-458f-8b67-45ad1b2ab7f0","resolution":{"observed_at":"2026-08-07T15:43:03.454182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02057","last_updated":"2024-02-03T06:37:50Z","snapshot_observed_at":"2026-08-07T21:53:50.848655Z","submitted_at":"2024-02-03T06:37:50Z","title":"Break the Sequential Dependency of LLM Inference Using Lookahead Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02057","snapshot_observed_at":"2026-08-07T15:42:52.964039Z","title":"Break the sequential dependency of llm inference using lookahead decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:52.964039Z"},"links":{"cited_paper":"/paper/2402.02057","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:46fc0c9b428cf4b5ab0620d367705b41b9ea2aae08eb7183f22402d810045aa9","observation_id":"40c1840c-6422-42a9-9344-4dacfb33782b","resolution":{"observed_at":"2026-08-07T15:42:52.964039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.179028Z","title":"On speculative de- coding for multimodal large language models, 2024","venue":null,"work_id":"442b7d8f-f11a-443c-8545-d6073feafb63","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.096692Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:fc95cbef61414781b718aa34d684855742ece508a95060428f015f8f82b8a13d","observation_id":"db0aa4eb-b18e-4dcd-9db6-1983100197a2","resolution":{"observed_at":"2026-08-07T15:43:03.284745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.045531Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"c0611a14-3903-40e7-8b15-b8e6943b02eb","year":2017},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.184615Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:9ea92b7b47e215b3b3f897fb28792ad25bc13e9eb79b6d20a5e3e01ec71d1152","observation_id":"e8600f12-c8e8-4e6d-bf18-324907bf2c49","resolution":{"observed_at":"2026-08-07T15:43:03.107501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.793799Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":"865fa195-4051-4282-9500-29fa581e64a0","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.273506Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:3255f500bd6e822e41c195803992750a838d706b7fce0b8ee7dd35d0551f20c9","observation_id":"e755fa42-dd18-4317-a2b3-9d9c1240456e","resolution":{"observed_at":"2026-08-07T15:43:02.878228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.463707Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"5e1d1621-8032-4da9-9550-4fd3ae2da0da","year":2016},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.386578Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:d5974f3656491a680276a1d40d50937d6f43e09e41df1e256064a5cb6277dace","observation_id":"00150653-8d2e-4abe-93b2-8d56c5ad849c","resolution":{"observed_at":"2026-08-07T15:43:02.615171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.215636Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"e1406124-e67d-4085-a90e-81b55dbdf471","year":null},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.502385Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:54cb938505978b0d10ec9112e5040a09f1ff450c226046b16519ab7579a15dc6","observation_id":"e581eb29-484a-4097-97be-101792a256b0","resolution":{"observed_at":"2026-08-07T15:43:02.306653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.974874Z","title":"Fast in- ference from transformers via speculative decoding, 2023","venue":null,"work_id":"f9f0d072-36c3-48fd-a940-fd1a7ab9c537","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.602320Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:7d603a7c768f0d998f512dd9aff7349e2f519fce2a8e3eb8278e7b43aec7d315","observation_id":"df04763c-b5f0-4827-aee5-b89b7354b870","resolution":{"observed_at":"2026-08-07T15:43:02.079645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.770231Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"90d141c7-58b6-4a47-a405-bdbf1be95716","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.666871Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:f2d12f9c592a969038cd76508817e9bc725cc1efa356d3e48577f0ac5ff0c7c1","observation_id":"a7c93abb-242d-4d10-bde5-3d0554f5ef1d","resolution":{"observed_at":"2026-08-07T15:43:01.815404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.496568Z","title":"Mbq: Modality-balanced quantization for large vision-language models, 2025","venue":null,"work_id":"b2606f53-5d4a-4abe-9295-4fc086094be7","year":2025},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.769305Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:75b5457f6849d6ff8e6de8df704ac1aa726be1739494a633405c7d0fc2a09e9c","observation_id":"21f14983-b513-4013-aeb5-2932a222da6a","resolution":{"observed_at":"2026-08-07T15:43:01.617127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.258690Z","title":"Tokenpacker: Efficient visual projector for multimodal llm, 2024","venue":null,"work_id":"0e48a61e-ac50-4b1c-8e88-a69df8b73e10","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:53.976045Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:764c29e7ca080558556fc97dc152be9486a5c6c5edb43baa43dbce0759a1aa6f","observation_id":"5240c826-d93f-4cdd-824b-a258b39e2219","resolution":{"observed_at":"2026-08-07T15:43:01.352493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:01.034746Z","title":"EAGLE-2: Faster inference of language models with dy- namic draft trees","venue":null,"work_id":"2267d38c-34c9-4298-9843-9b628515474e","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.072661Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:be933566d92c4d03588ca30dfbab4631d37fced287fb5f0fed6e46e00b787df5","observation_id":"67046b93-e169-4e1e-96d0-0e3727a4473c","resolution":{"observed_at":"2026-08-07T15:43:01.132549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.844742Z","title":"EAGLE: Speculative sampling requires rethinking feature uncertainty","venue":null,"work_id":"3ff6815b-a5e3-4b0c-bacc-18e61af1fcf3","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.172704Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:8dce4386b84b644d603c203f80c24b9d904416e6e176098787f43b4e21055a82","observation_id":"44eecb0f-c787-40ae-a6bb-4606fbfc0afe","resolution":{"observed_at":"2026-08-07T15:43:00.916324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-07T15:42:54.275560Z","title":"Moe-llava: Mixture of experts for large vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.275560Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:b67ceac181337cd719b1837317bac4ef4bca8e7eba55430a70bbdc287c70cc4a","observation_id":"e58f0841-c3dd-4168-914c-81caba70ba05","resolution":{"observed_at":"2026-08-07T15:42:54.275560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.686916Z","title":"Boosting multimodal large language models with visual to- kens withdrawal for rapid inference","venue":null,"work_id":"3c124c84-317d-4415-a25b-f21caaaf5936","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.379762Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:ec615122a5db4eeb49c3fb1a5b0f33076020846c3944dd678ce4f6d5bd68ea6a","observation_id":"fb07f3c9-5560-4d84-ae63-8a5668afcedc","resolution":{"observed_at":"2026-08-07T15:43:00.756646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.467204Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"ef3ce3b6-f592-40ef-99c9-2b8a1fc1e62e","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.468070Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:677904aadafd280cbb6c8cdba513b88be86ef396f988eefeb4dbd427855d4e70","observation_id":"7329108f-1ae6-449f-965e-d2f725a69bb8","resolution":{"observed_at":"2026-08-07T15:43:00.538357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.300959Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"d11f2316-994d-48ce-9d17-ea0076e409be","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.618384Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:563e8861c7bed63abf0ceca5bf3c03b471798064529e9e0cf9a1dcf8b5149234","observation_id":"35094642-eb29-49a9-8ad5-976e6191ee16","resolution":{"observed_at":"2026-08-07T15:43:00.419555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:00.004831Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2023","venue":null,"work_id":"34fb1669-430d-4c4a-8f96-560293b47464","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.717220Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:c548334bde96d7ccc6d9838868bfecfbbb48281de8f9d05b1f18ee6e3512ba3f","observation_id":"6220cd67-de78-4ac0-81a0-8e3d457447ef","resolution":{"observed_at":"2026-08-07T15:43:00.118135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.753624Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"6d3f0088-8787-4f4f-a63c-f12fc6461fd2","year":2022},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.806172Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:ea0cb6b887ae3b0bad54279dfe35eba2dc3100364bca239b307dd33783541412","observation_id":"986fedbd-0afd-4107-8494-be3dbdc3aad6","resolution":{"observed_at":"2026-08-07T15:42:59.857099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.551659Z","title":"ChartQA: A benchmark for question an- swering about charts with visual and logical reasoning","venue":null,"work_id":"2062fdf9-5ed9-4bb2-b05b-a771ce12c19a","year":2022},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:54.900842Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:81a911bb58ee61ac38adc68a96f455c959ff2d5c2c9984e5a824efe1533fabba","observation_id":"207bbc7e-f974-421d-8697-829ca8da4c0a","resolution":{"observed_at":"2026-08-07T15:42:59.680608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:59.301458Z","title":"Mm1: Methods, analysis and in- sights from multimodal llm pre-training","venue":null,"work_id":"2f63efd4-621c-4674-b688-255527f3c03d","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.018726Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:ed19cbb4037ec984ef2b5ed84cae321cc08213b603af3e16a82f03118ed2fb41","observation_id":"53475137-9217-4efa-b2a9-87ad353e4469","resolution":{"observed_at":"2026-08-07T15:42:59.426790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:55.084527Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.084527Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:96a7281221e71bf99b29aa70bb711b03f021d5830c43f8a5227855d84ab418c4","observation_id":"e5507623-85a9-4fa1-848a-c3647f6cdb67","resolution":{"observed_at":"2026-08-07T15:42:55.084527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.917304Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"91642d07-621e-4df9-933b-459a9a3bf14f","year":2021},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.175992Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:ac7c1f270ba9ac07a6dec5e66ba36353d377634c7c34cc1437e9eccf27f5ed8f","observation_id":"b7bc08e0-ec7a-4491-a807-8c5a8b5bdafb","resolution":{"observed_at":"2026-08-07T15:42:59.052147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.678151Z","title":"Crossget: cross-guided ensem- ble of tokens for accelerating vision-language transformers","venue":null,"work_id":"114b9734-27f2-4774-bfd5-1af3d4985207","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.378336Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:74bae4aab2685746df7af8c0b062049cf304b180da1972029b4c81d473649708","observation_id":"19239ca9-9e8a-4aa9-9123-15b289b32672","resolution":{"observed_at":"2026-08-07T15:42:58.783792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.435280Z","title":"Towards vqa models that can read","venue":null,"work_id":"71aa4a84-7c24-4385-a9f0-e508f9a0e07c","year":null},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.483714Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:f93fe6615952d467785f6719ad4ee305777dd9587836afc6d40e1977f917bcf2","observation_id":"f628e393-4091-47fc-9b2e-6495cd4a7187","resolution":{"observed_at":"2026-08-07T15:42:58.567691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:58.067940Z","title":"Gemini: A family of highly capable multimodal models, 2023","venue":null,"work_id":"ffa99e3a-626d-434d-8b2e-6a88140c1216","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.579960Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:5e9f58cfd52cef1cb1757660f812f308b2d7fd653f52b59b0d7369f12529c29f","observation_id":"174f5246-7735-4a63-9e22-aa1561093d9a","resolution":{"observed_at":"2026-08-07T15:42:58.189988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08119","last_updated":"2025-02-24T01:36:56Z","snapshot_observed_at":"2026-07-06T19:31:18.802964Z","submitted_at":"2024-10-10T17:02:48Z","title":"Q-VLM: Post-training Quantization for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08119","snapshot_observed_at":"2026-08-07T15:42:55.672801Z","title":"Q-vlm: Post-training quanti- zation for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.672801Z"},"links":{"cited_paper":"/paper/2410.08119","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:cbd4909f939a43c281190fb0c843c759ecfca62d9c01c464957146c2aeda7c49","observation_id":"f5c3e04f-90a1-43b1-a083-a396502bbb87","resolution":{"observed_at":"2026-08-07T15:42:55.672801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:57.755742Z","title":"Large multimodal model compression via iterative efficient prun- ing and distillation","venue":null,"work_id":"fb087333-9b4b-4960-9c4f-3d3313d510c3","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.730004Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:4b29f88c6acae9900af274de3b4ad39ab57780135a86d55d472268e618ef3a66","observation_id":"625280b5-3ea4-4d1a-a6bc-a95f5059fee9","resolution":{"observed_at":"2026-08-07T15:42:57.935490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:57.578393Z","title":"Ppt: Token pruning and pooling for efficient vision transformers, 2023","venue":null,"work_id":"15f8c008-9620-4870-8a86-71bc591eab03","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.802858Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:4354f49393f4c5fdb6a401be4ba741340261c4f178e6c254f48ffcfecd5ec535","observation_id":"92345a1f-c526-408b-bc67-86134a9b672a","resolution":{"observed_at":"2026-08-07T15:42:57.686430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:57.299400Z","title":"mplug-owl: Modularization empowers large language mod- els with multimodality, 2024","venue":null,"work_id":"ea6efa87-7f77-40d7-b91e-846b6498f803","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.863908Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:bafa8bd891e110c89269d02407ce42fb14ae4f51adb2fedf6eb7cf63b0f2246a","observation_id":"3af64a77-fdc8-47e3-9376-1d68bc731d99","resolution":{"observed_at":"2026-08-07T15:42:57.404553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.986877Z","title":"Generation meets verification: Accel- erating large language model inference with smart parallel auto-correct decoding","venue":null,"work_id":"9e7b1295-1d54-43d1-9fb7-6c7ca613995d","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:55.955642Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:257130214873bbdc3f96b4336814a68522a553a4f5cd7b36d1fecc69c138d0f3","observation_id":"be0b5308-a3d3-45b4-bce2-be9e6adb24a8","resolution":{"observed_at":"2026-08-07T15:42:57.136593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.895864Z","title":"Draft& verify: Lossless large language model acceleration via self-speculative decoding","venue":null,"work_id":"4364a810-0588-446e-a341-feb3a4bcaa56","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.015580Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:db555627d2ca3548f0d56db72801c180a34353f493b5d3615ea5cc6447138a5d","observation_id":"a7e61b52-b387-400e-abea-ad29daf30a8e","resolution":{"observed_at":"2026-08-07T15:42:56.950279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.737856Z","title":"Learning harmonized representations for speculative sampling, 2024","venue":null,"work_id":"88b49d3f-6c80-4643-8625-e98ee6430881","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.084348Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:e45bb41ba8f18eefb92d08664cbe360050e713ea8f5a19d3fc66fd5232741038","observation_id":"da12a79a-721c-4b19-83ec-cd7f8a09eda0","resolution":{"observed_at":"2026-08-07T15:42:56.802116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.615854Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":"d269b04e-4e39-497f-b0dc-c1fe32d877b9","year":2023},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.141651Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:bae4801854d5c2bf487ce95b7e6fa63893f3190921263a322690f5f854cef732","observation_id":"5bee170d-f6b2-4047-acff-1e972a7594c2","resolution":{"observed_at":"2026-08-07T15:42:56.679378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-03T05:27:32.394774Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-07T15:42:56.206898Z","title":"Tinyllava: A frame- work of small-scale large multimodal models.arXiv preprint arXiv:2402.14289, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.206898Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:ac30ff7af376bdadc78cb372bf52cea57585ce6e43bdd9d1ce0f5ee8dbe61e64","observation_id":"04cc1c5d-e3fa-4e99-b933-ece44387040a","resolution":{"observed_at":"2026-08-07T15:42:56.206898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:56.478419Z","title":"Llava-phi: Efficient multi-modal assistant with small language model","venue":null,"work_id":"39a9c86a-cfe4-40e9-98cc-9e652becf588","year":2024},"citing_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.294364Z"},"links":{"citing_paper":"/paper/2505.14260"},"observation_digest":"sha256:033a4bb39c0103bc62222ed63e217c2406ec239a6ecd7b6cab544b075ef49e83","observation_id":"10f9c9d9-75e0-4ad6-bb35-d5d11f6e01c2","resolution":{"observed_at":"2026-08-07T15:42:56.539136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 4 inbound Pith citation observations for arXiv:2505.14260."}