{"as_of":"2026-08-08T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7fd2bee60e752e41d5bd788b90bc538f1ab6174e148db1a76bfa988c18707032","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T19:34:58.789459Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.23483/citation-record","integrity":"/paper/2603.23483/integrity","json":"/paper/2603.23483/citation-record.json","paper":"/paper/2603.23483"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:d02ea5cc974d998492a755d544e2910cd778cb6da0ae8b05fe538b3c12745ab7","observation_id":"34e54f63-db9d-4116-9061-15db86c94e90","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:dac858dada6392de40d01a83a6fef0db048d730b65396c5402769a4f812ceb00","observation_id":"54c7000b-c7f6-4b4b-8c2d-6c6747185dec","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Token merging: Your vit but faster.arXiv preprint arXiv:2210.09461, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:9100336e1d7ef527cc43a255afa3de0a834586084960c54f28366f459d9ceb23","observation_id":"9635897f-d81f-4526-af72-c268849e872a","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads.arXiv preprint arXiv:2401.10774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:a888fa83ac89a3a1278fb5c0f41e1b597d23fd23041432204b70039e9a027654","observation_id":"46ee54ee-686e-4a6c-98ba-a983bea94e1a","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Accelerating large language model decoding with speculative sampling.arXiv preprint arXiv:2302.01318, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:f4ea0dbf30c32e979f212a091e95bb692ea4a9d39f043cb37a7ad10f1fdf9656","observation_id":"c58291ce-3fb6-4e7c-b5a1-5c3d7bfa37a0","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04916","last_updated":"2024-06-16T08:37:25Z","snapshot_observed_at":"2026-07-06T16:58:43.934362Z","submitted_at":"2023-12-08T09:31:50Z","title":"EE-LLM: Large-Scale Training and Inference of Early-Exit Large Language Models with 3D Parallelism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04916","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Ee-llm: Large-scale training and inference of early-exit large language models with 3d parallelism.arXiv preprint arXiv:2312.04916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2312.04916","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:10a9bc792db3cd906c30322f58c59fc7282a48efe7e628a90ffc86c900705e74","observation_id":"d5e4f275-a1da-4fe6-948e-c3f13720c793","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Sensenova-mars: Empowering multimodal agentic reasoning and search via reinforcement learning.arXiv preprint arXiv:2512.24330, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:9a733b4b4aa884bd22bbff46bb45db2cf85f83764006aef4f977226242a6a982","observation_id":"470689ce-c0bf-446b-b395-60530e85f5be","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning.Advances in neural information processing systems, 36:49250–49267, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:03f503fa15429b8867e43788211ad5c1dc140275a4419915152915cdabea3f91","observation_id":"61464e67-6d1f-4c14-b154-ba829024aeca","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Introducing Agentic Vision in Gemini 3 Flash.https://blog.google/innovation-and-ai/tech nology/developers-tools/agentic-vision-gemini-3-flash/, January 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:6e53998e18fa9cbf9049c3361af3453a8574400425d14536c892dd639cac82dc","observation_id":"ad7d7b0e-1c20-4616-ac1d-5ffd55ea5570","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Feather the throttle: Revisiting visual token pruning for vision-language model acceleration.ICCV, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:7a64e290c0bf0229318af4c918df454efc01b8cbb6159c7681e57d957051de23","observation_id":"3837c31c-48ad-4fd8-bf45-3c743b5c4dbb","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02181","last_updated":"2024-07-09T11:59:01Z","snapshot_observed_at":"2026-07-06T17:39:16.540553Z","submitted_at":"2024-03-04T16:23:58Z","title":"Not All Layers of LLMs Are Necessary During Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02181","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Not all layers of llms are necessary during inference.arXiv preprint arXiv:2403.02181, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2403.02181","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:7b4c16d8d14a50373c3609182183b800f9ab937adb43118746dbbfb8a527de0b","observation_id":"cc2b33b2-b2ca-4e61-ad20-7f2e725eeba2","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Framefusion: Combining similarity and importance for video token reduction on large vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:69975a4e5e1ac0fe3446b227e70fc1be76226867b44c557d494ca7c757e601ec","observation_id":"21086179-5cc2-4cc4-bcb4-dfe6dc198c08","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15260","last_updated":"2025-08-21T05:48:38Z","snapshot_observed_at":"2026-08-02T03:10:09.020351Z","submitted_at":"2025-08-21T05:48:38Z","title":"Deep Think with Confidence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15260","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Deep think with confidence.arXiv preprint arXiv:2508.15260, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2508.15260","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:10d10cf42623276aeb17138020548c90d22c38229cd211332e06844e2f6087fa","observation_id":"9c2bab70-f4cc-4cea-8fdc-e1c106154e02","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Thinking with programming vision: Towards a unified view for thinking with images.arXiv preprint arXiv:2512.03746, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:b3b4fc0176a70f343f3dc39be1c90fe2e96df00bc4b669266571f25ac387822f","observation_id":"e8ff4a20-f182-41dc-86fe-a9e413a6b2ce","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08584","last_updated":"2024-12-18T07:45:11Z","snapshot_observed_at":"2026-07-06T19:31:40.352383Z","submitted_at":"2024-10-11T07:24:21Z","title":"ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08584","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Zipvl: Efficient large vision-language models with dynamic token sparsification, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2410.08584","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:20bfd60fc7a7d082b867e2a5fc428eb3a55765f1679dad8e3c8e61b6f398a29f","observation_id":"71cb0fa2-72e8-4804-a2ac-c617994cabc5","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Deepeyesv2: Toward agentic multimodal model.arXiv preprint arXiv:2511.05271, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:1518c112ad0a1f22792502f8613f2345bcd79f82f4a71a4f684062299ade2501","observation_id":"5907ab8e-022f-4083-9490-742b9b978eaf","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Thinking with drafts: Speculative temporal reasoning for efficient long video understanding.ArXiv, abs/2512.00805, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:f64a7ea394c799500da9cfe77d8090543f30541fdbb5a688ac20dddf4f54130b","observation_id":"5adaf7d2-6f7a-4960-8627-9141ec49af55","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Relayllm: Efficient reasoning via collaborative decoding.ArXiv, abs/2601.05167, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:651529d6a9443e00fa82a28216fffcc2f9e66989ea0fb3e01c17a3a5a339f6fa","observation_id":"1770a245-7b8d-4866-ae0e-74e3e5e96826","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Evolver: Chain-of-evolution prompting to boost large multimodal models for hateful meme detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:f359d43a09a218dbc01b7ad832a028e7a20ff2669723e103595f95b786926a6e","observation_id":"7be1eb8d-0728-4f8b-b0dd-8395a292ad02","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Token fusion: Bridging the gap between token pruning and token merging","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:32df96415020f3e3bdd7b35d65e54f936a8610ab29921eb1cf7051b3312e24f7","observation_id":"30cc7fc8-5829-4141-93c3-35b8206bb8a9","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Helios: Adaptive model and early-exit selection for efficient llm inference serving.arXiv preprint arXiv:2504.10724, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:1dc35932db33ae84e2ecd71e7233eecdf9b2d159c2a947b9f38676d7467acafc","observation_id":"e02c6d94-8efc-40ea-88dd-6571b75fbc34","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07969","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Mini-o3: Scaling up reasoning patterns and interaction turns for visual search.ArXiv, abs/2509.07969, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2509.07969","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:9ab51bfdb950808a23482edc74a03d0fcf670f3fa2d963aed82182440cf012ae","observation_id":"b0e2d2ac-a1aa-4845-ab46-49f8b9db3524","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:c55c31f3c7e18b7b8c56da5076eb95a25b92a0e5aa02eed47c3cb1e3ca095f57","observation_id":"57eb8671-8594-4c3d-9b62-6b218fbbc181","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:60bc657992987a4802436c4eb32513df494d579d174cc27507b04610bd0baa8c","observation_id":"8304f4df-66d0-4576-b068-6176a1889d54","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Hero: Rethinking visual token early dropping in high-resolution large vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:53fc4f534c1a65c3ad5d81dff83c5502530287cb401ca5d3a6de10e4d981fb14","observation_id":"7dffeb42-2ff9-48b8-b07a-fb2b9128e09d","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:899fbba8e88b337c86535ab002e8f75762d9406f188b3d300399354f21896395","observation_id":"2962bf72-0d68-4f07-a9ad-ef73252a0a98","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"doi: 10.18653/v1/2023.emnlp-main.20","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:903d841d013fb9e86745c7be730c2648609b2f933b49ab9bde196f9dd89f4ac7","observation_id":"f4b2ba77-373f-49ce-ad84-8bb63e273a85","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Eagle: Speculative sampling requires rethinking feature uncertainty.arXiv preprint arXiv:2401.15077, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:2b069618356e5a9c7f1aa896d2e5dc4a136447541aa91405aeb465a062dc34d8","observation_id":"865dc1a7-07b6-4cbd-b977-bc6601ca1654","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Eagle-2: Faster inference of language models with dynamic draft trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:0e98cf1b40a370c58484e4b34baff548a70eec4a51dd59ff2f4198e557ad12ef","observation_id":"aeca9d6b-6911-460a-8817-b66377ca052f","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01840","last_updated":"2025-04-23T07:08:17Z","snapshot_observed_at":"2026-07-06T20:45:55.263034Z","submitted_at":"2025-03-03T18:59:04Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01840","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Eagle-3: Scaling up inference acceleration of large language models via training-time test.arXiv preprint arXiv:2503.01840, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2503.01840","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:d28bd0ad30307fc37db8d3478b747f69ca76b0eeed6f3db2eed7cb07b1afa291","observation_id":"d2091b90-f24d-49c8-8bdf-6a008faf3a68","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Moe-llava: Mixture of experts for large vision-language models.IEEE Transactions on Multimedia, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:b6868a66e5b0f74f99e881812270f81ef3b620f550293a226e75128109ca104a","observation_id":"b468e171-18ce-477c-bfb3-1a1ef890b242","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14260","last_updated":"2025-05-20T12:12:17Z","snapshot_observed_at":"2026-08-08T01:17:15.105745Z","submitted_at":"2025-05-20T12:12:17Z","title":"Speculative Decoding Reimagined for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14260","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Speculative decoding reimagined for multimodal large language models.arXiv preprint arXiv:2505.14260, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2505.14260","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:b3f868f804114d2da1eb94e58e07e281c4797bfdd7019a56fd4af2d67a395065","observation_id":"8ef8e9bd-1a19-4d4c-a9c4-16e926bbd613","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Accelerating multi-modal llm gaming performance via input prediction and mishit correction.arXiv preprint arXiv:2512.17250, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:4d76c4746a55988fe76799c458900c65393f43142fd8a31e326dab9feba3da4c","observation_id":"c28b0408-a7a4-48c1-b2f8-d954127d7d56","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Efficient inference of vision instruction-following models with elastic cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:ec951fde3e5281dba32a6234832968e7bf3e445f4e3b5f152a1ec066c912ae45","observation_id":"5113e20f-ef45-4ef2-a4ec-dd415cb88929","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension.arXiv preprint arXiv:2411.13093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:980a8d64fc7b2b3bdadd0dc57ff4b7c8e2d7ff574615080a8f8e54b684ef46cf","observation_id":"ed59f10a-b025-44c8-8478-96155b13dfcf","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Quota: Query-oriented token assignment via cot query decouple for long video comprehension","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:50b1e179b7ee6795ea95e0078fa1c2984168898cf22fffb8800e860237c58fc2","observation_id":"92c3a50f-89bb-4581-a27b-0d86d16ce91c","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Introducing OpenAI o3 and o4-mini.https://openai.com/index/introducing-o3-and-o4-mini/ , April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:ce4761ca6a874861ecf4cfb0cfca2ca84c9cdacbbf06d4501a97f0576d9d6fc7","observation_id":"91a9334f-8741-45d2-8aa6-4df40d3e0291","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07891","last_updated":"2025-05-16T19:27:32Z","snapshot_observed_at":"2026-08-07T16:06:47.574045Z","submitted_at":"2025-04-10T16:05:19Z","title":"SpecReason: Fast and Accurate Inference-Time Compute via Speculative Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07891","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Specreason: Fast and accurate inference-time compute via speculative reasoning.arXiv preprint arXiv:2504.07891, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2504.07891","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:cd6251ef232cc337f3f55f61035883934c4c3e0f546a7195d2c742aa86bfb5e7","observation_id":"505f063e-809c-4352-a29c-3175fb56c820","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-07T16:07:44.263463Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Skywork r1v: Pioneering multimodal reasoning with chain-of-thought.arXiv preprint arXiv:2504.05599, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:ba75685a033629ca3090b10a5057d498b094803c6f7d757c001ac7109ed27824","observation_id":"68baa483-9c90-4e76-8b4e-2da6fe045052","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Toolformer: Language models can teach themselves to use tools.Advances in neural information processing systems, 36:68539–68551, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:16c9a783e3b2ef10943c77bcd8eae35613d6fa2a62733bda68ae55fb8da2a743","observation_id":"5cec84e8-696c-426f-aa9f-973b5c627484","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Mmspec: Benchmarking speculative decoding for vision-language models.arXiv preprint arXiv:2603.14989, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:5f37c06adc5ab177e93b4268cc0e7e885c126d6f00e6a707c43501ddf7a148de","observation_id":"e04f0807-dfd7-4296-8400-b8e374934018","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face.Advances in Neural Information Processing Systems, 36: 38154–38180, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:ac82f16276cf411fa7e66eee32cca0fbc60979156f41a3f77270c6b4b8a06107","observation_id":"768424c4-a3f0-4d6a-9bba-8ada2c25b8ce","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Codedance: A dynamic tool-integrated mllm for executable visual reasoning.ArXiv, abs/2512.17312, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:d294d1d94c2fc9c67b181afea94bccdb6611e166d2cab04fa9c6df28136d18c0","observation_id":"8fb8a25a-fb83-4f89-834a-d4863fd8685d","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:efb6ac95ce8b8a0bd1cf97cd8a0362901bf2b256b2d1e7c757deeb4d9123c90d","observation_id":"3af15faf-0a09-45b0-bff6-2e5aa8371daf","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:5a4686ca3aea825314edcfcad55a595f4b14db8d964996339cd2be5866e91672","observation_id":"48f721f0-df1e-4110-b945-6c01c828914e","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:d282d33a5cdf68f5dce5250c145ced455054caed2d88720440cee77866449bd2","observation_id":"c43f5d66-9646-4004-9d86-aba71934fe96","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Branchynet: Fast inference via early exiting from deep neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:18b2692df0ca218be925046a2492af88eb3fa82a09f00a0ecee7af12ddec44dd","observation_id":"390f05de-486e-4e6f-9ba0-9688c9851933","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Look-m: Look-once optimization in kv cache for efficient multimodal long-context inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:59509b65227bc85fb34e94be00193269c53c407808ed0a9e23472413cd4b5c94","observation_id":"6ca8693a-df7b-4d48-90c9-2baaf131be25","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Meda: Dynamic kv cache allocation for efficient multimodal long-context inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:36f35f97f52bc9020e1fdfacb4f49ba3bd70a6209cc2cae8c01b69f0315bc928","observation_id":"39829c2f-335e-4840-9dc0-a52800e8b6ae","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Fourier-vlm: Compressing vision tokens in the frequency domain for large vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:5a7cf6c1b4d56788bfe9a72e78ce5351d770c1a764bc6bf06e74aeaf0790ba2f","observation_id":"a7f7de56-a813-4e29-8ef1-e6b43ea53ec5","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:f26f9fb850cea370394b3561dc8a2d846515c909c42aaeb5c4a8730abe1d7574","observation_id":"6035e410-db77-413a-b73b-28e2a565e747","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Efficient visual transformer by learnable token merging.IEEE transactions on pattern analysis and machine intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:1027055911fda58ad5f070549eba5a12957fbff8c3e2d588a6b297c9bb9016e5","observation_id":"d7b79076-2a35-4c51-b3a5-e1c7c493d74f","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-07T15:14:57.062481Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"V*: Guided visual search as a core mechanism in multimodal llms.arXiv preprint arXiv:2312.14135, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:072e2c0af8025ddbc671419f25d3cc6ca9404642a168b72256889e7762d03284","observation_id":"1e1dfc9c-74da-4b71-a0dc-5347b54124fa","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Speculative decoding: Exploiting speculative execution for accelerating seq2seq generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:ede2a6e658324c9d2b3042026641b91c04c16169f9d2125e33d698cb9ae5149d","observation_id":"917e1973-cdee-4155-b008-137144e81711","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06916","last_updated":"2025-03-06T03:04:44Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:15:30Z","title":"SWIFT: On-the-Fly Self-Speculative Decoding for LLM Inference Acceleration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06916","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Swift: On-the-fly self-speculative decoding for llm inference acceleration.arXiv preprint arXiv:2410.06916, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2410.06916","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:f0da6ebff7854c619769b47d4cc0eb5b7c0cfd95dd0d9ec9f4e45e0b51e9f039","observation_id":"04da9712-272a-4d07-9bd5-fd6b33f8eac3","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Pyramiddrop: Accelerating your large vision-language models via pyramid visual redundancy reduction.arXiv preprint arXiv:2410.17247, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:ced5ad22cb7af9134a6b2bd257d253f532e4bd8e94072031776577188429aad0","observation_id":"a7fa7d87-6cf9-444e-a70e-feef499a50ce","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Specee: Accelerating large language model inference with speculative early exiting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:ca370a756fd056ea5b2d712210a23e8d14ee464ddb70c9b9e54c362094d42de6","observation_id":"43b4f0ac-d0b9-43aa-b95b-3accc145fc80","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Longspec: Long-context speculative decoding with efficient drafting and verification.arXiv e-prints, pages arXiv–2502, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:566228a33eb462ee3bbbfbce0315e0fbc519f91f3f5cc71ded98cd9ad11961f2","observation_id":"90f6e4e4-9d6a-40ca-ac97-2974fca5bac3","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:b4b8520c076a8e750a43fddf7cfcd0c975d75df055f53dc3e2d5b053e1f28811","observation_id":"3cd65eb9-9a7b-40c5-950c-0cbc922ea680","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Deep but reliable: Advancing multi-turn reasoning for thinking with images, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:3accbffd0a43e12e84de9e02fd69e6fe2f8b94c8ad7b4ecc25fdcd5f2e027e40","observation_id":"a4f9cf90-e7b9-4db2-909b-475ca8403595","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:64da7bfd689f044b89ccebee8f5222e1cb2ad6435dc4a6125336f3ec6be7ec01","observation_id":"1bf4a10b-c5a0-4f54-a40f-2973e24afd36","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Recode: Unify plan and action for universal granularity control.arXiv preprint arXiv:2510.23564, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:c42b329695e146045a8e0b36ec003af4744543cbea5101c2342a1c6afacf795b","observation_id":"11d17b4a-0b54-47a3-95ab-0573ef314f30","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Draft& verify: Lossless large language model acceleration via self-speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:cff446048243d935b88818270f36e509c7cbc4d4c37bc46f04e96101b643e37e","observation_id":"9fcbd1c0-cbd5-4a0b-b67d-522c33f97ba2","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11630","last_updated":"2025-08-15T17:59:49Z","snapshot_observed_at":"2026-08-03T04:02:35.392835Z","submitted_at":"2025-08-15T17:59:49Z","title":"Thyme: Think Beyond Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11630","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Thyme: Think beyond images.arXiv preprint arXiv:2508.11630, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2508.11630","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:d25100c533fb4823e35e1b5db52bc2f4040abd338f028b8257ff7b8324232e4f","observation_id":"ffaec66f-9e07-42a3-a149-5aa13e857523","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Skywork-r1v4: Toward agentic multimodal intelligence through interleaved thinking with images and deepresearch.arXiv preprint arXiv:2512.02395, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:d3e05033900c47c360ea6c2697e7f60892cc71c66c78fef13d8f7722ce4c7797","observation_id":"7d601fa2-3a86-448c-abc2-b676d0b0ec21","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Pyvision-rl: Forging open agentic vision models via rl.arXiv preprint arXiv:2602.20739, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:b254c28fc79883606ab902fba4d55491a66514369dc7954981961506d9679211","observation_id":"b43cb2e3-f411-45ce-8550-35ee74138446","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"A stitch in time saves nine: Small vlm is a precise guidance for accelerating large vlms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:4b5a35072ef0b10abadecc3c42f1492a61593e43c6dfa741295c1879ef714f41","observation_id":"3fcb76a2-6f1f-473a-9f8e-f4d68862fa0d","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"thinking with images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:ff81ea6a3251eddf366e861aef3e417ca7d4b028e01506c0578297495e27f7e2","observation_id":"52934f59-9efa-4e84-a9a9-b67ee85806c3","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14919","last_updated":"2024-03-22T02:44:05Z","snapshot_observed_at":"2026-08-06T09:15:24.769827Z","submitted_at":"2024-03-22T02:44:05Z","title":"Hierarchical Skip Decoding for Efficient Autoregressive Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14919","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"Hierarchical skip decoding for efficient autoregressive text generation.arXiv preprint arXiv:2403.14919, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2403.14919","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:c640455f30e416b5f5ac928500c7efa272b3b38887383d61c3405da8d52e23af","observation_id":"99bea7b0-4e6a-41ce-8900-29b07aa04b48","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2603.23483."}