{"as_of":"2026-08-19T07:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6645ad7b5be64fda437dae10a459fa49db454bfb3f6d406d2a88b580be2257c7","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:34:16.703536Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:31:44.517145Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T21:31:45.066251Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"cited_work":{"arxiv_id":"2504.17892","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17892","snapshot_observed_at":"2026-08-11T21:31:45.066251Z","title":"Token Sequence Compression for Efficient Multimodal Computing","venue":"cs.CV","work_id":"88b21a11-0702-4617-b16f-cc32a95490ed","year":2025},"citing_paper":{"arxiv_id":"2412.04449","last_updated":"2025-08-06T16:57:39Z","snapshot_observed_at":"2026-08-14T02:35:33.601057Z","submitted_at":"2024-12-05T18:58:03Z","title":"p-MoD: Building Mixture-of-Depths MLLMs via Progressive Ratio Decay","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:31:44.517145Z"},"links":{"cited_paper":"/paper/2504.17892","citing_paper":"/paper/2412.04449"},"observation_digest":"sha256:f3c24049458bd914e1fa027add1c10b86b959acf1dadb8236937eb84699fb650","observation_id":"a809c974-a1d4-4aa0-a0aa-b8b498adb9a9","resolution":{"observed_at":"2026-08-11T21:31:45.074721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.17892/citation-record","integrity":"/paper/2504.17892/integrity","json":"/paper/2504.17892/citation-record.json","paper":"/paper/2504.17892"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:17.056733Z","title":"A multimodal architecture for ai agents, 2023","venue":null,"work_id":"8059b87a-e6c3-47f4-9587-639b0b5649c5","year":2023},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.602109Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:6833ad6ebb0e8c5f6d16b66e535038c01e5dc28ca06be65ca2a4c2475d546ea0","observation_id":"4a78ded4-8a92-4aaa-a465-8944dcc5a272","resolution":{"observed_at":"2026-08-16T10:34:17.061184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:17.042965Z","title":"Token merging: Your vit but faster","venue":null,"work_id":"3dc192c6-791e-4c76-8919-848a1038265e","year":null},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.608026Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:9b79df47cd5c6dd8b0301718b4e6adf486547317acc60b75acea23b382a7ce83","observation_id":"a5d2f209-181e-496d-8490-615ba2603449","resolution":{"observed_at":"2026-08-16T10:34:17.047608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:17.029458Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"dcc507ec-378c-4833-8f32-fddbce97be8e","year":2024},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.612332Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:f1f7e346ac80432f8f4ee97bd09cf39aa4203cc7b246272b37e1a3ee1fd528cb","observation_id":"693a7eb5-bfbe-4cb5-81e3-e487fa364f70","resolution":{"observed_at":"2026-08-16T10:34:17.033981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-16T10:34:16.616677Z","title":"Sun, Xing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.616677Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:2c0b90ebdfac873390e0a9a1f95e0b1ce98fa0cf564f763f0dbadbffb151799b","observation_id":"c43e1943-2d31-402e-8503-8685a083bf33","resolution":{"observed_at":"2026-08-16T10:34:16.616677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:17.015769Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"584d4e51-22b7-4ef2-99ec-6ff7d651c7b5","year":2019},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.621133Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:5b5175d9157e6c510b58adb40752b4efc6ba9f6b1d7b4f259f4f4f52a4698c14","observation_id":"ea89dfbb-b98e-4bb9-913a-73c111eb7851","resolution":{"observed_at":"2026-08-16T10:34:17.020084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03206","last_updated":"2021-06-23T00:25:31Z","snapshot_observed_at":"2026-08-16T18:41:11.947734Z","submitted_at":"2021-03-04T18:20:50Z","title":"Perceiver: General Perception with Iterative Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03206","snapshot_observed_at":"2026-08-16T10:34:16.625879Z","title":"Perceiver: Gen- eral perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.625879Z"},"links":{"cited_paper":"/paper/2103.03206","citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:1eb33ddc01f83cd62a7f914be05fd031e7a2ad90cf35304756a0a48a9966b251","observation_id":"c0443a45-2164-455c-b96d-6d119e3cdb53","resolution":{"observed_at":"2026-08-16T10:34:16.625879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:17.002452Z","title":"Towards efficient visual-language alignment of the q-former for visual reason- ing tasks","venue":null,"work_id":"f9d98a3f-01e8-4125-9b20-546268d5a6a6","year":2024},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.630399Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:70e4d5245fd84f366822360b61d0c703b6967b0ab9680bc866aee9a15333f84a","observation_id":"3092b459-a3eb-40c7-8e2b-4c055d4cefc8","resolution":{"observed_at":"2026-08-16T10:34:17.006773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.989622Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":"f73702db-0b60-4d01-9bc6-86824dc7480b","year":2024},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.634727Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:afa261b0dd01dba0bf9f5dcc2127039c2ca363ffbc42126856e1d234640ed404","observation_id":"769df055-957c-4c70-9a3c-61711c810f86","resolution":{"observed_at":"2026-08-16T10:34:16.993732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.976458Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"afcc883a-26b4-4880-899e-7986cf2b13a0","year":2023},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.638677Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:0c64b55f0fe22d3ebf8c3da6cd4c6bbfdf36d2afaffd82d9bf3142592c7a050f","observation_id":"9cc093b6-24cf-42f2-8872-ac28aa6964cf","resolution":{"observed_at":"2026-08-16T10:34:16.980827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-16T10:34:16.642522Z","title":"Evaluating object hallucina- tion in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.642522Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:2f3bd3a8ad171fb8a3e77b2e3db15cdc4cb408191385e24c5421d6795f7dc5ad","observation_id":"b6c77503-6edc-415d-b963-a5a1caea6dfb","resolution":{"observed_at":"2026-08-16T10:34:16.642522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.963238Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"4841e1b2-f691-4ff3-bd14-38dfc32e995d","year":2024},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.646783Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:33dbf6e7de4b62fdef207487e4a760d5824185a3f7b40a4e8395b0920a5ced5e","observation_id":"ef17429c-fcbc-4651-a657-d8d1282c74f3","resolution":{"observed_at":"2026-08-16T10:34:16.967529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-16T10:34:16.650651Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.650651Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:3ceedad3fdc41a069f96382549c891908b4e49fa25884abb5a961ff7e8cd6e6c","observation_id":"3d034a8a-b008-4a08-9316-0f1a5407658d","resolution":{"observed_at":"2026-08-16T10:34:16.650651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.949977Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge","venue":null,"work_id":"4b6b6e0c-88ac-48d6-9d30-01a16690652e","year":2024},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.655013Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:34425074481b199d0edd776c1cc9fec8b046ae88970451508a1ba985990dc149","observation_id":"8b10226c-38a9-49f4-8ad8-231b41d9079d","resolution":{"observed_at":"2026-08-16T10:34:16.954232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-16T10:34:16.659149Z","title":"Liu, Ziwei","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.659149Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:912023bdf0dbf776c82f5f55adb7eb68474e1164a278d0c4db1eba765bb72998","observation_id":"50708892-7149-437b-9553-899a08765bc6","resolution":{"observed_at":"2026-08-16T10:34:16.659149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.936365Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"69c1fc33-4bc3-4a1b-bae5-8765562da6cf","year":2022},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.663960Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:7338a20791be79bd0ad375a0cce4c9086a8da102fa3c8268642a7970b520f168","observation_id":"ade9eed7-f91b-4eab-8e3e-677dacce5f1b","resolution":{"observed_at":"2026-08-16T10:34:16.941028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.923116Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"235bd64c-295f-4b5b-908d-0f6c8f27a613","year":null},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.667608Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:0c1750634b58bbd064d6762db627c3220c3ede263e984e7eaafa8d3f78e03b74","observation_id":"84364a5f-d43c-4bcb-95ec-5e1b3323eb15","resolution":{"observed_at":"2026-08-16T10:34:16.927347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.909859Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":"1bcc9b20-ea76-41d8-9670-3b2beffc1ba4","year":2024},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.671649Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:f9a7c6e83e49239f6a4e9b0d643a1895b96abbb72f7644d40685db89f5ed5ac1","observation_id":"169b392e-d44b-4f91-a208-eb8275377bae","resolution":{"observed_at":"2026-08-16T10:34:16.914243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.895139Z","title":"Towards vqa models that can read","venue":null,"work_id":"69135454-c381-4369-921f-932160163dd7","year":2019},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.675605Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:df08a81b59330d7b623f5368f29f4b59de6195793045f8c2d30607f672f5dc5b","observation_id":"2255e0cc-cfa5-4979-9417-87a98d688b15","resolution":{"observed_at":"2026-08-16T10:34:16.900023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.881039Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"93597ab0-a484-43df-9f29-50fa8f630dc5","year":2023},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.679365Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:40907f786afe493fb8bdf344ac883abc703b7ea02eb5a01f451fa06ff6ca8318","observation_id":"ed5fc4ea-c91a-443b-b807-3a5321940efe","resolution":{"observed_at":"2026-08-16T10:34:16.885111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.867347Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":"bb44fc0f-f4ce-45a6-b8db-b0551c95fae8","year":2024},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.683267Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:358ddecc986b27a57887cf0023da63af5dfae62a23419729c3f30e6655a7c13f","observation_id":"72e1df33-5ca7-4d9e-8236-2a4417ee3bf8","resolution":{"observed_at":"2026-08-16T10:34:16.871734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.853984Z","title":"X-vila: Cross-modality align- ment for large language model","venue":null,"work_id":"cd4dc9d6-b2c5-4b2a-bb8c-2ff5a9198cc2","year":2024},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.687215Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:1dc25f554bfa5bba2f49a32d078dd4b06e60635148fcb9ad05c98e3afd9a1c1d","observation_id":"581969a4-9e02-4872-bedd-83577b5e6cc4","resolution":{"observed_at":"2026-08-16T10:34:16.858512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.840439Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":"4661743f-f42a-4985-bd73-7b49522fcf81","year":2024},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.691295Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:3025f7d6325c88f674de1d0f87f002b95ef35eafb32a286db8cce3e5c7449d58","observation_id":"736433ff-84ff-4c46-b937-5ef4e7766373","resolution":{"observed_at":"2026-08-16T10:34:16.844846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-18T23:15:35.529250Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-16T10:34:16.695161Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.695161Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:9c10f9311c6c6e159d16c03a79006e6180fccde86550b26cf58a478bccf7a9ba","observation_id":"1976f3d4-e1ff-4750-82be-1a0e20bd777b","resolution":{"observed_at":"2026-08-16T10:34:16.695161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:34:16.825321Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"ced7b0d7-28c6-4aa7-97b5-4a0f4eb04391","year":2023},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.699603Z"},"links":{"citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:787f0ea8edee90d4a9d3eabd0afab940524362ea0ae4163480b574eedd26d650","observation_id":"980db933-c9f3-4f20-b082-57dd7fdb5880","resolution":{"observed_at":"2026-08-16T10:34:16.831138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-08-15T01:31:24.363496Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-08-16T10:34:16.703536Z","title":"Sparsevlm: Vi- sual token sparsification for efficient vision-language model inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:34:16.703536Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2504.17892"},"observation_digest":"sha256:4e59b0751cb78268f85ee02c552b383a3e9b75bbd5751c9e19484df328c4cd20","observation_id":"c34eabbf-2f40-45e8-8169-338c768cda8b","resolution":{"observed_at":"2026-08-16T10:34:16.703536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.17892","last_updated":"2025-04-24T19:11:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T02:46:06.603396Z","submitted_at":"2025-04-24T19:11:10Z","title":"Token Sequence Compression for Efficient Multimodal Computing"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2504.17892."}