{"as_of":"2026-08-22T11:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f6ba8170924b18d06afdf99471324e256f56b664aef0b2bbc9905c8b0f78242","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:15:26.802931Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T22:35:40.607778Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-08-08T13:35:05.167918Z","title":"Efficient vision-language models by summarizing visual tokens into compact registers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-20T12:42:31.568607Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.167918Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:e1a710efe12a6b65a7d4176d2c8473ed33e12bd59f37154a8b8a4578c3f83588","observation_id":"e4cab989-0a6d-4dfa-9ae4-4b98aa9cc0e1","resolution":{"observed_at":"2026-08-08T13:35:05.167918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-08-16T11:15:26.802931Z","title":"Efficient vision-language models by summarizing visual tokens into compact registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16083","last_updated":"2025-05-23T10:09:51Z","snapshot_observed_at":"2026-08-20T02:55:33.859916Z","submitted_at":"2025-04-22T17:59:51Z","title":"MMInference: Accelerating Pre-filling for Long-Context VLMs via Modality-Aware Permutation Sparse Attention","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T11:15:26.802931Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2504.16083"},"observation_digest":"sha256:506d89d70bdeb11a744ec40f3b3413bae3578475e8d34871e5f0a56ef714a36e","observation_id":"3ab00f2c-d575-4688-9b0d-11d75f682727","resolution":{"observed_at":"2026-08-16T11:15:26.802931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-08-06T18:39:06.590851Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08064","last_updated":"2026-06-06T18:51:46Z","snapshot_observed_at":"2026-08-16T10:13:30.458348Z","submitted_at":"2025-07-10T16:47:25Z","title":"PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:06.590851Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2507.08064"},"observation_digest":"sha256:23b3bd42074a346ad2dd8b8aad7fa65b297ca2418cf3b3d9dd26ce92b440e247","observation_id":"cc86dd3a-0cd2-4c62-9ca1-94c6bc54c6a6","resolution":{"observed_at":"2026-08-06T18:39:06.590851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-08-06T16:33:58.959189Z","title":"Efficient vision- language models by summarizing visual tokens into compact registers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-19T03:39:30.749912Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:58.959189Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:1627210b4099a42683062fdd818b88cc765202b6b4049f5e5f475981857b1db5","observation_id":"00402166-99a3-4c38-b206-feb971afe9d9","resolution":{"observed_at":"2026-08-06T16:33:58.959189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":"2410.14072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-07-08T22:35:40.607778Z","title":"arXiv preprint arXiv:2410.14072 , year=","venue":"cs.CV","work_id":"a421db48-d34b-4af9-9ac4-671fdb8cae3e","year":2024},"citing_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-08-21T07:01:40.887307Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T07:06:20.470686Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2601.03233"},"observation_digest":"sha256:e14b992ff17a9919874ed3f4944614772a5dbc95280784880538ada0e1838bc5","observation_id":"b869b41c-3b6d-4852-a8d3-bb4d66106308","resolution":{"observed_at":"2026-05-13T07:06:20.575068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":"2410.14072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-07-08T22:35:40.607778Z","title":"arXiv preprint arXiv:2410.14072 , year=","venue":"cs.CV","work_id":"a421db48-d34b-4af9-9ac4-671fdb8cae3e","year":2024},"citing_paper":{"arxiv_id":"2603.26041","last_updated":"2026-08-09T16:37:37Z","snapshot_observed_at":"2026-08-13T23:27:09.424950Z","submitted_at":"2026-03-27T03:21:19Z","title":"Where and How to Prune: An Empirical Study of Visual Token Pruning for GUI Agent Navigation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T23:59:49.017251Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2603.26041"},"observation_digest":"sha256:90d7e9d6038d9e9c15c4562b51d605db0b5fef2b8db691d013eab6dcac396dad","observation_id":"ad6581d7-6d82-468c-bc17-d4b3f4c91d32","resolution":{"observed_at":"2026-05-15T00:03:20.148788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":"2410.14072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-07-08T22:35:40.607778Z","title":"arXiv preprint arXiv:2410.14072 , year=","venue":"cs.CV","work_id":"a421db48-d34b-4af9-9ac4-671fdb8cae3e","year":2024},"citing_paper":{"arxiv_id":"2605.16638","last_updated":"2026-05-15T21:10:56Z","snapshot_observed_at":"2026-08-03T04:32:55.741433Z","submitted_at":"2026-05-15T21:10:56Z","title":"TTE-Flash: Accelerating Reasoning-based Multimodal Representations via Think-Then-Embed Tokens","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-20T18:00:18.315737Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2605.16638"},"observation_digest":"sha256:3e7171a59ddb1f180e7e051f405c276814ea248964a40a11dac9c4131f15de22","observation_id":"963c0819-29ba-4857-a82c-9b74e7c00c16","resolution":{"observed_at":"2026-05-20T18:03:36.946492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":"2410.14072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-07-08T22:35:40.607778Z","title":"arXiv preprint arXiv:2410.14072 , year=","venue":"cs.CV","work_id":"a421db48-d34b-4af9-9ac4-671fdb8cae3e","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:06f3de4d66fc04583e2bdf5bd3ba9ef62fbfed1a8d08b0be04f8ea4b5b5b8a54","observation_id":"845780f1-5d67-4024-8896-568df97ed835","resolution":{"observed_at":"2026-07-08T22:35:40.609039Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-07-14T15:15:45.858365Z","title":"arXiv preprint arXiv:2410.14072 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09827","last_updated":"2026-07-10T11:47:55Z","snapshot_observed_at":"2026-08-19T05:52:10.092411Z","submitted_at":"2026-07-10T11:47:55Z","title":"TDSal: Task-Based Top-Down Saliency Prediction Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T15:15:45.858365Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2607.09827"},"observation_digest":"sha256:20aae7f0b14bf55472a82b81da0e5cc18dff929fcfb8c61b75477f4b5c9ba525","observation_id":"73dadc04-5cae-49e7-adf0-cd500339a263","resolution":{"observed_at":"2026-07-14T15:15:45.858365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-08-06T15:31:59.237877Z","title":"Efficient vision- language models by summarizing visual tokens into compact registers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04833","last_updated":"2026-08-05T13:34:13Z","snapshot_observed_at":"2026-08-19T04:43:43.894786Z","submitted_at":"2026-08-05T13:34:13Z","title":"RegisterBridgeMM: A Register-Centric Framework for RGB-Infrared Object Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:59.237877Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2608.04833"},"observation_digest":"sha256:99e20604d156a3be96c7e5ac32e9dcf85d54fc040ff97577f6625f888ae6601f","observation_id":"6fc7e5d8-6bd2-47c6-9e9b-6d743ae275d5","resolution":{"observed_at":"2026-08-06T15:31:59.237877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-08-10T04:30:14.299362Z","title":"arXiv preprint arXiv:2410.14072 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06411","last_updated":"2026-08-04T05:44:07Z","snapshot_observed_at":"2026-08-21T20:54:22.455373Z","submitted_at":"2026-08-04T05:44:07Z","title":"Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T04:30:14.299362Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2608.06411"},"observation_digest":"sha256:509192301e3fcfd1ca466efd8b5cd2cb7df8ab996f21343790ab016e6693a0a6","observation_id":"f7e6a82c-d1ad-4b30-9c0c-272f3de478b9","resolution":{"observed_at":"2026-08-10T04:30:14.299362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.14072/citation-record","integrity":"/paper/2410.14072/integrity","json":"/paper/2410.14072/citation-record.json","paper":"/paper/2410.14072"},"outbound":[],"paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-21T02:46:40.147262Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2410.14072."}