{"as_of":"2026-08-05T22:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ea471a0998697dbb826d34d53b9d20c33279c679a42199bd39b84617034e6fe","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:36:43.892124Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:16:46.738649Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T08:19:44.559138Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.07574","snapshot_observed_at":"2026-08-02T18:16:46.738649Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.14785","last_updated":"2026-07-26T17:22:03Z","snapshot_observed_at":"2026-08-02T18:16:43.947213Z","submitted_at":"2026-03-16T03:35:04Z","title":"SkipOPU: An FPGA-based Overlay Processor for Large Language Models with Dynamically Allocated Computation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T18:16:46.738649Z"},"links":{"cited_paper":"/paper/2602.07574","citing_paper":"/paper/2603.14785"},"observation_digest":"sha256:a6692a1e786f77d472e414e68004d59bf7a9660df5e9f9f7d00be7d5ef92cd54","observation_id":"36894a2f-169f-4e22-aa11-c9d715c1990f","resolution":{"observed_at":"2026-08-02T18:16:46.738649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"cited_work":{"arxiv_id":"2602.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07574","snapshot_observed_at":"2026-07-04T08:19:44.559138Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","venue":"cs.CV","work_id":"a6a24176-5e00-4f62-8080-29fda7e3709c","year":2026},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-02T14:00:57.631473Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2602.07574","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:dbc2be82db026f961d742519d6fb401b4fbe207aac7cb21c3dda903d7320e3f0","observation_id":"0ff9dad2-ab9e-4d4a-9b72-d7405e708a29","resolution":{"observed_at":"2026-07-04T03:19:29.982411Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"cited_work":{"arxiv_id":"2602.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07574","snapshot_observed_at":"2026-07-04T08:19:44.559138Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","venue":"cs.CV","work_id":"a6a24176-5e00-4f62-8080-29fda7e3709c","year":2026},"citing_paper":{"arxiv_id":"2606.22126","last_updated":"2026-06-20T16:08:44Z","snapshot_observed_at":"2026-08-01T20:27:12.377624Z","submitted_at":"2026-06-20T16:08:44Z","title":"From Recognition to Understanding: Unlocking Cognitive Time Series Reasoning with LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T11:49:04.883246Z"},"links":{"cited_paper":"/paper/2602.07574","citing_paper":"/paper/2606.22126"},"observation_digest":"sha256:2e063a5ac2930eb715599df0648f328823145c544bba5c8fc3f9ede0e70f9036","observation_id":"5477009a-0d09-4044-911e-9ec5cb869b84","resolution":{"observed_at":"2026-07-04T08:19:44.560480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.07574","snapshot_observed_at":"2026-07-31T05:06:55.036228Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24954","last_updated":"2026-07-27T18:04:26Z","snapshot_observed_at":"2026-08-01T00:03:34.329535Z","submitted_at":"2026-07-27T18:04:26Z","title":"Intrinsic and Triangulation-Agnostic Attention: A Simple and Powerful Approach for Learning on Meshes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T05:06:55.036228Z"},"links":{"cited_paper":"/paper/2602.07574","citing_paper":"/paper/2607.24954"},"observation_digest":"sha256:1ba41b52785e11b46bb6337d143f3e79dd54e45ed8fbd842c1be58143d0eb523","observation_id":"a404a56c-7951-4876-828e-90c1de1ccc84","resolution":{"observed_at":"2026-07-31T05:06:55.036228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.07574/citation-record","integrity":"/paper/2602.07574/integrity","json":"/paper/2602.07574/citation-record.json","paper":"/paper/2602.07574"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T03:36:43.786045Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.786045Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:07f177ed62beefb75a93d83e8037322c136cebbecea31c338bbbb100d2377516","observation_id":"c941f91f-458d-424b-bfee-57c79342a20f","resolution":{"observed_at":"2026-08-03T03:36:43.786045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.797433Z","title":"From llms to lrms: Rethinking pruning for reasoning-centric models.arXiv preprint arXiv:2601.18091,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.797433Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:616198ed4dbf533cfc33a40494de456bdae28b7c60d8a2555d22f6cbb299b5c9","observation_id":"66d283e1-b9c9-4aac-a3a6-5ebdbb55a070","resolution":{"observed_at":"2026-08-03T03:36:43.797433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.800697Z","title":"Visipruner: Decoding discontinuous cross-modal dynamics for efficient multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.800697Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:069dd80fb1b5db256312e690ee31a3931a3aef7ef117f2399f8fa99972dcadb1","observation_id":"e581471b-eaaa-4f14-bc2b-e3565ed59700","resolution":{"observed_at":"2026-08-03T03:36:43.800697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.803774Z","title":"The framework tax: Disparities between inference effi- ciency in NLP research and deployment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.803774Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:adfe3e78ef528b5cf8512191ceb595ef387503199f1807efb16ba659a9a6de8c","observation_id":"ba9bde6f-dc17-470b-b9ca-27ae5a9e6181","resolution":{"observed_at":"2026-08-03T03:36:43.803774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-03T03:36:43.806789Z","title":"Mme: A comprehen- sive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.806789Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:a2e5121f6ba27c487f6bb35539022086a22ef9f5393cb4a8ccd4613b2805cf20","observation_id":"a00e5172-ce7a-4dab-a7b9-6aceeea84fb6","resolution":{"observed_at":"2026-08-03T03:36:43.806789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.813342Z","title":"Filter, correlate, com- press: Training-free token reduction for mllm accelera- tion.arXiv preprint arXiv:2411.17686,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.813342Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:b5de553a00d8102bbd8d830614bb7c842849e1ccb351aff14c4e8952d8e19965","observation_id":"725bcd9b-1c9d-45b9-85f1-f21bfefa4233","resolution":{"observed_at":"2026-08-03T03:36:43.813342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.819419Z","title":"Training-free token pruning via zeroth-order gradient estimation in vision-language models.arXiv preprint arXiv:2509.24837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.819419Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:e552c6f62dd7741ead0b32a486072eee7c55302283d7066f3723997a88beb5bc","observation_id":"e6ac5bc9-df02-4fb8-b581-a2bcfa666296","resolution":{"observed_at":"2026-08-03T03:36:43.819419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.822334Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.822334Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:f746f86c1abd6d215fddebb06989e35db996d540bf8be2c82d31c90553a16bae","observation_id":"2698dd5f-f538-4696-9fc2-925bfeb145e0","resolution":{"observed_at":"2026-08-03T03:36:43.822334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.885996Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.885996Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:49fc5c4bafd4b8b67d182738d92cdd4715bf7ca38c4125f76ad0a8b3229c4a1b","observation_id":"fe6a8878-5f93-4c2b-a242-d594f641f58d","resolution":{"observed_at":"2026-08-03T03:36:43.885996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.831132Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.831132Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:57bcb3620e2da01e32974d4ae46586fc76c5f3706b53ba696bb4fb2dd49b13f0","observation_id":"f79e5802-4c2a-456f-93e8-e2229b6e0f5a","resolution":{"observed_at":"2026-08-03T03:36:43.831132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.833966Z","title":"The few govern the many: Unveiling few-layer dominance for time series models.arXiv preprint arXiv:2511.07237,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.833966Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:8d3aa2a3375888f385aa47471f19caec6aca634333f35165bcce5e2b5d8ec7fa","observation_id":"344c15a1-56d7-4455-85a7-9c432869e3f9","resolution":{"observed_at":"2026-08-03T03:36:43.833966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14075","last_updated":"2026-04-10T01:08:12Z","snapshot_observed_at":"2026-07-06T20:54:36.522651Z","submitted_at":"2025-03-18T09:52:45Z","title":"Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14075","snapshot_observed_at":"2026-08-03T03:36:43.836659Z","title":"Growing a twig to accelerate large vision-language models.arXiv preprint arXiv:2503.14075,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.836659Z"},"links":{"cited_paper":"/paper/2503.14075","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:7684f141bd5d9e8a3b85c68d92ab028f37022b03a412fc7bc76995380ec42369","observation_id":"f6a59e34-f22e-4c8d-9df7-618e24ce7a7d","resolution":{"observed_at":"2026-08-03T03:36:43.836659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10372","last_updated":"2023-05-16T03:00:22Z","snapshot_observed_at":"2026-07-06T13:54:45.559365Z","submitted_at":"2022-09-21T14:05:30Z","title":"WeLM: A Well-Read Pre-trained Language Model for Chinese","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10372","snapshot_observed_at":"2026-08-03T03:36:43.839708Z","title":"Welm: A well-read pre-trained language model for chinese.arXiv preprint arXiv:2209.10372,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.839708Z"},"links":{"cited_paper":"/paper/2209.10372","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:809a4cfb5ce3e04b61d314d2add86427c81b08f8a547d5a77b1e4adeef9f82fa","observation_id":"6f6e8c13-3300-4526-90f7-e31565de98f1","resolution":{"observed_at":"2026-08-03T03:36:43.839708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06563","last_updated":"2024-04-05T06:39:34Z","snapshot_observed_at":"2026-08-04T12:09:32.831508Z","submitted_at":"2024-03-11T10:05:29Z","title":"Unraveling the Mystery of Scaling Laws: Part I","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06563","snapshot_observed_at":"2026-08-03T03:36:43.842782Z","title":"Unraveling the mystery of scaling laws: Part i.arXiv preprint arXiv:2403.06563,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.842782Z"},"links":{"cited_paper":"/paper/2403.06563","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:093f9717ad4fba87a2fa6a280a9dbb67213ee90de324be4b0d113a5feb4c2228","observation_id":"1fd97f3b-7b79-4986-bc5d-e941bd1876c4","resolution":{"observed_at":"2026-08-03T03:36:43.842782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.845796Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.845796Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:9f809f672c06576362e5ad65b55b77f27d9782897b142dda3171a762bcc96c07","observation_id":"2e46ced7-cd4e-4db9-b348-b7ac0ab0b99d","resolution":{"observed_at":"2026-08-03T03:36:43.845796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10501","last_updated":"2025-03-13T16:04:31Z","snapshot_observed_at":"2026-07-06T20:52:04.228632Z","submitted_at":"2025-03-13T16:04:31Z","title":"TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10501","snapshot_observed_at":"2026-08-03T03:36:43.848589Z","title":"Tokencarve: Information-preserving visual token compression in multimodal large language models.arXiv preprint arXiv:2503.10501,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.848589Z"},"links":{"cited_paper":"/paper/2503.10501","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:91b2b103662744a7ae4805128a94f3692a43068b5585034af148552ebe698f10","observation_id":"422fd897-39a2-45c6-b90b-6c39a3d0f062","resolution":{"observed_at":"2026-08-03T03:36:43.848589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.851615Z","title":"Flowcut: Rethinking redundancy via information flow for efficient vision-language models.arXiv preprint arXiv:2505.19536,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.851615Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:cdedb0e654136bc52da11ae546954803b9104d6757f4ef15d80e7551f5a6c120","observation_id":"3d4548d6-a087-41d5-86cf-b33d5ca5d617","resolution":{"observed_at":"2026-08-03T03:36:43.851615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T03:36:43.854536Z","title":"Llama: Open and efficient foundation lan- guage models.arXiv preprint arXiv:2302.13971,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.854536Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:92709a7eabb50f27c176f0bb7393896a9b2d54a0507283a62768c2115ea98cf9","observation_id":"77fa743d-5dae-40b2-8c33-67135aaea41d","resolution":{"observed_at":"2026-08-03T03:36:43.854536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T03:36:43.857558Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.857558Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:00d878cf71ef184f22ca668cf884bd6a6631446af0405ec56598e289f885df15","observation_id":"e4a79494-0980-49de-93da-1059d4310440","resolution":{"observed_at":"2026-08-03T03:36:43.857558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-03T03:36:43.860430Z","title":"Internvl3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.860430Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:265bc4922002e137737edacfbc19db1551cca772e98b0d70bd3cb93efc5bae47","observation_id":"a379abfc-05fe-4aee-bb5f-0ce88744d63f","resolution":{"observed_at":"2026-08-03T03:36:43.860430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11494","last_updated":"2025-06-08T08:35:58Z","snapshot_observed_at":"2026-07-06T20:37:37.864423Z","submitted_at":"2025-02-17T06:56:28Z","title":"Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11494","snapshot_observed_at":"2026-08-03T03:36:43.863246Z","title":"Token pruning in multimodal large language models: Are we solving the right problem? In Che, W., Nabende, J., Shutova, E., and Pilehvar, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.863246Z"},"links":{"cited_paper":"/paper/2502.11494","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:c81ca3255ce607f23991186e02dbcd9efc58a92286765f492e02ad05672cd547","observation_id":"018b7785-79ee-4344-a710-5e45add4c883","resolution":{"observed_at":"2026-08-03T03:36:43.863246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-03T03:36:43.866305Z","title":"Pyramid- drop: Accelerating your large vision-language models via pyramid visual redundancy reduction.arXiv preprint arXiv:2410.17247, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.866305Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:d315aaa9601d7c09d75eee9aa19290097e1f52ff0282a4229db997a66b649e2a","observation_id":"8d0b4ba3-5918-4c10-af00-09dbfa938a6a","resolution":{"observed_at":"2026-08-03T03:36:43.866305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.869360Z","title":"Shortv: Efficient multi- modal large language models by freezing visual tokens in ineffective layers.arXiv preprint arXiv:2504.00502,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.869360Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:99e72f9baeeb3656b7885270dfdfb5aed62ea00487181c29718d46f2fb244e42","observation_id":"068ed5f8-001a-4c3a-b897-6ec3b1f2a7d8","resolution":{"observed_at":"2026-08-03T03:36:43.869360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.871953Z","title":"and Shukla, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.871953Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:21cd0cb8ab0feb940b2d9f7ad5b4811d44ae2aa2c72df44d9240efc874a86365","observation_id":"70140cca-3983-45bf-b5b3-eec4c05b5e23","resolution":{"observed_at":"2026-08-03T03:36:43.871953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21817","last_updated":"2025-07-03T08:22:27Z","snapshot_observed_at":"2026-07-06T20:59:54.016142Z","submitted_at":"2025-03-26T04:16:48Z","title":"Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21817","snapshot_observed_at":"2026-08-03T03:36:43.874806Z","title":"Skip-vision: Efficient and scalable acceleration of vision-language models via adaptive token skipping.arXiv preprint arXiv:2503.21817,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.874806Z"},"links":{"cited_paper":"/paper/2503.21817","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:e0f9d50440ab0caea04dcb3016c67ce76973b09de4b08746453eb000d91a5205","observation_id":"e035451b-2ac5-4803-9ea6-bea64010fbf2","resolution":{"observed_at":"2026-08-03T03:36:43.874806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.877803Z","title":"Vscan: Rethinking visual token reduction for efficient large vision-language models.arXiv preprint arXiv:2505.22654, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.877803Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:0307c44402e9cf03e16b198c9407a70625e02cd93c2a9bd3ffdc274951ae1212","observation_id":"fe600739-bc70-4b9b-b5f5-0881241d255b","resolution":{"observed_at":"2026-08-03T03:36:43.877803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-02T08:30:01.611621Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-03T03:36:43.880446Z","title":"Cross-modal information flow in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.880446Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:ecad71823f3a9fa4e838bf9fb62bb03ab521d44a2276671b871b32635f7c919a","observation_id":"9f8eb748-1179-4bab-a8f9-329a9567700c","resolution":{"observed_at":"2026-08-03T03:36:43.880446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.883350Z","title":"Don’t just chase” highlighted tokens” in mllms: Revisiting visual holistic context reten- tion.arXiv preprint arXiv:2510.02912,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.883350Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:36ccdc38f6c61389465d5f8180ff2c081ed0875f4c26f570d4790d82fd58d23a","observation_id":"1d029859-003d-4829-b021-a177564b018d","resolution":{"observed_at":"2026-08-03T03:36:43.883350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.889099Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.889099Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:80b7bdecaccac56c5bb9eda0c966bd5dde4a84d8dfd800097daf6f8c4c548bab","observation_id":"9c9823b9-2a33-4884-8775-97d688063185","resolution":{"observed_at":"2026-08-03T03:36:43.889099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.892124Z","title":"(b) Our method under eager attention, where visual tokens are frozen via explicit masking and participate in attention only as key–value representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.892124Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:5f4c6aa217c5d51057e49528cda806e05739ccef4ca28cc62f17648d27c64961","observation_id":"eba19160-294e-465f-af7b-e273d149be6e","resolution":{"observed_at":"2026-08-03T03:36:43.892124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-03T03:36:43.825189Z","title":"Li, B., Ge, Y ., Ge, Y ., Wang, G., Wang, R., Zhang, R., and Shan, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.825189Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:f3c211e2492d35cb83acdc063508046b9086f039d83aea439d88738eca0269b7","observation_id":"e48dae1a-7083-4a06-9cc9-8fe29af1ac0b","resolution":{"observed_at":"2026-08-03T03:36:43.825189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.810118Z","title":"Informed routing in llms: Smarter token- level computation for faster inference.arXiv preprint arXiv:2510.13831,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.810118Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:c1218b0f8cb6b13f0880bf0580b395846b7fc66fd1da5b6b5c5eeb0955c5936c","observation_id":"2ff8ca33-d940-433b-be82-67ebea37e28f","resolution":{"observed_at":"2026-08-03T03:36:43.810118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.828231Z","title":"BLIP-2: Boot- strapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.828231Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:933bad9b476db29f0f367ff9ccbedeb19376802fd2b1bc9e3793e384c891dd0b","observation_id":"e25429e2-c7ad-4414-a600-650fcb048802","resolution":{"observed_at":"2026-08-03T03:36:43.828231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:36:43.794122Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.794122Z"},"links":{"citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:832b9eb935540bc2efeead050307c9611c0598e17179cbc6980896bcfcecab4d","observation_id":"91f02fb3-bf7b-443b-a0cb-d07aa6f705b0","resolution":{"observed_at":"2026-08-03T03:36:43.794122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00876","last_updated":"2025-03-21T13:30:33Z","snapshot_observed_at":"2026-08-02T05:57:58.328221Z","submitted_at":"2024-12-01T16:32:31Z","title":"Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00876","snapshot_observed_at":"2026-08-03T03:36:43.816273Z","title":"Dynamic-llava: Effi- cient multimodal large language models via dynamic vision-language context sparsification.arXiv preprint arXiv:2412.00876,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.816273Z"},"links":{"cited_paper":"/paper/2412.00876","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:f74427620f11f3e82260931f9303c061ab449dec39ded14d4b6a29aae9e72517","observation_id":"42a9394c-6e02-47db-8123-83d92b80befd","resolution":{"observed_at":"2026-08-03T03:36:43.816273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T03:36:43.790329Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.790329Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:4d4fa82f1f6a40a0fe469981705a4e00b7ea163842f7af5298dc579de37363bc","observation_id":"ba07eca3-772f-4565-9d43-a4718bd14d41","resolution":{"observed_at":"2026-08-03T03:36:43.790329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 4 inbound Pith citation observations for arXiv:2602.07574."}