{"as_of":"2026-08-08T12:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cca039919901ed7701b6035d169aa4952bfa20021e9fe897c0539caf2acfa774","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:29:09.281677Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:40:36.389460Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T13:20:26.673617Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05709","snapshot_observed_at":"2026-08-07T00:40:36.389460Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13045","last_updated":"2025-08-24T10:01:04Z","snapshot_observed_at":"2026-08-08T06:33:39.031465Z","submitted_at":"2025-06-16T02:27:25Z","title":"Continual Learning for Generative AI: From LLMs to MLLMs and Beyond","version":4},"reference_index":243,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:36.389460Z"},"links":{"cited_paper":"/paper/2506.05709","citing_paper":"/paper/2506.13045"},"observation_digest":"sha256:7a21e593eaf2e8ee2881aa937492d5c99b2e76a7e9ebd680a0c48b078289d50b","observation_id":"cd619d8b-e160-4609-ba92-0965376c5715","resolution":{"observed_at":"2026-08-07T00:40:36.389460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"cited_work":{"arxiv_id":"2506.05709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05709","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token transforming: A unified and training-free token compres- sion framework for vision transformer acceleration","venue":null,"work_id":"292903b3-d9e9-4f61-9010-85847de54a98","year":2025},"citing_paper":{"arxiv_id":"2604.13432","last_updated":"2026-04-15T03:06:24Z","snapshot_observed_at":"2026-07-06T23:01:28.082506Z","submitted_at":"2026-04-15T03:06:24Z","title":"MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T13:06:09.392876Z"},"links":{"cited_paper":"/paper/2506.05709","citing_paper":"/paper/2604.13432"},"observation_digest":"sha256:e0d97a7ba44455ce3b0965569caeacee151312e5330ea4331ce48adfc30f2430","observation_id":"176cd46b-7d57-4bd3-b913-244b12844db4","resolution":{"observed_at":"2026-05-10T13:20:26.675894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"cited_work":{"arxiv_id":"2506.05709","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05709","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token transforming: A unified and training-free token compres- sion framework for vision transformer acceleration","venue":null,"work_id":"292903b3-d9e9-4f61-9010-85847de54a98","year":2025},"citing_paper":{"arxiv_id":"2604.14563","last_updated":"2026-04-16T02:46:53Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T02:46:53Z","title":"Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T11:31:52.126027Z"},"links":{"cited_paper":"/paper/2506.05709","citing_paper":"/paper/2604.14563"},"observation_digest":"sha256:8e073dfe4f0d7b387e2b3ab428e925da702d9e4afb9b3cbba677b8dfcab6adb1","observation_id":"3d6a8040-3b49-477c-ba34-4d78edc3078a","resolution":{"observed_at":"2026-05-10T11:35:18.966902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05709/citation-record","integrity":"/paper/2506.05709/integrity","json":"/paper/2506.05709/citation-record.json","paper":"/paper/2506.05709"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-07T10:29:04.281431Z","title":"To- 8 ken merging: Your vit but faster.arXiv preprint arXiv:2210.09461, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.281431Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:b48639bf4ad42592ef460534efad8474ddfa5f18ccc9b48acdcf136fa8b834a1","observation_id":"0888780a-745f-43c7-a35a-fbecf752f310","resolution":{"observed_at":"2026-08-07T10:29:04.281431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:04.388730Z","title":"Crossvit: Cross-attention multi-scale vision transformer for image classification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.388730Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:a52ea73811f626efb29bce513fc34ff5e0483ff19addfe1aa224f768ea7d50d6","observation_id":"5cab2b06-3244-4ce3-831a-2e70ad67fb4a","resolution":{"observed_at":"2026-08-07T10:29:04.388730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:04.502992Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.502992Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:706e9cb742841aba67c344f730c9d0b59971db4b1005b6b38d31445fbd90ec2e","observation_id":"0b1abe6f-8215-4308-be29-9f31d4057c79","resolution":{"observed_at":"2026-08-07T10:29:04.502992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:04.652087Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.652087Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:40d9d8086e373e7ba12f01cd47b3f3d56b7627872560b5d7a12c2f03c6a8c1c3","observation_id":"4fb8e953-7fe6-4d69-868f-042896b35c86","resolution":{"observed_at":"2026-08-07T10:29:04.652087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T10:29:04.745969Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.745969Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:f7f37c23880ba5d42b1b449731e5617de0f5662a38b64cd8ed904ea5b5ef5107","observation_id":"e9372569-a820-4c8b-b1ed-e90341c7b665","resolution":{"observed_at":"2026-08-07T10:29:04.745969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.701112Z","title":"Adaptive token sampling for efficient vision transformers","venue":null,"work_id":"0fbda449-3100-42f3-8079-31b52a3b1890","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.879291Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:83bd7933e020f4a83edcae13a6720d8836da03b056af0647f3af9a067756f321","observation_id":"f5b48f0c-07db-4424-98a3-57a965da433f","resolution":{"observed_at":"2026-08-07T10:29:43.711924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.05331","last_updated":"2019-01-28T05:25:48Z","snapshot_observed_at":"2026-08-06T15:58:12.532400Z","submitted_at":"2018-10-12T03:00:59Z","title":"Dynamic Channel Pruning: Feature Boosting and Suppression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.05331","snapshot_observed_at":"2026-08-07T10:29:04.957294Z","title":"Dynamic channel pruning: Feature boosting and suppression.arXiv preprint arXiv:1810.05331,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:04.957294Z"},"links":{"cited_paper":"/paper/1810.05331","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:51b4c3f072f7c222d8eb11d386cdb0d9cc5fed5a3ecd6c6cfdbb5a56923cc6ec","observation_id":"a64d3003-f149-462d-8504-445086b060fb","resolution":{"observed_at":"2026-08-07T10:29:04.957294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:05.047412Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.047412Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:1c517447b6e9467d2fa926186dfb1821c2ac68fd65d6041a8dd9286897e5f5ba","observation_id":"ef0f1ead-73e8-4bac-b6ee-714e548b1e29","resolution":{"observed_at":"2026-08-07T10:29:05.047412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.673030Z","title":"Dynamic neural networks: A sur- vey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(11):7436–7456, 2021","venue":null,"work_id":"73d60e3c-0120-4837-b942-6580bdcdcf86","year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.135319Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:53420621e9566b1f98388473b600eaba8d27f07d4eee4d375e91939efe067ab7","observation_id":"b28c7a65-1c10-4b2c-8014-f04eef38c082","resolution":{"observed_at":"2026-08-07T10:29:43.681292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:05.210527Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.210527Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:b91c0432cdbd2a8a6a2d9459c629d0243133f542d41b4f625dedcbd15e6b1e42","observation_id":"46435033-fb1a-4eb3-ad6e-fba69d2779bf","resolution":{"observed_at":"2026-08-07T10:29:05.210527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T10:29:05.342081Z","title":"Distill- ing the knowledge in a neural network.arXiv preprint arXiv:1503.02531, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.342081Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:17978c84f8732fdcc5912a1e15501bb153333da709be4fe2b7df31fa3e44d27b","observation_id":"b56a5213-dfa2-4563-9664-36861b6d4660","resolution":{"observed_at":"2026-08-07T10:29:05.342081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.637929Z","title":"All tokens matter: Token labeling for training better vision transform- ers.Advances in neural information processing systems, 34: 18590–18602, 2021","venue":null,"work_id":"0f5af39e-edec-42a3-8641-c8286cc7c810","year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.430042Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:b1933beba6bad07f1a33b5699049f29e43d43bef56b263eaea1a08b502ed8bb2","observation_id":"bc203aa9-11cd-4c25-9936-ab7f1167166e","resolution":{"observed_at":"2026-08-07T10:29:43.651394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.617926Z","title":"Spvit: Enabling faster vision transformers via latency-aware soft token pruning","venue":null,"work_id":"89ea2383-5589-46aa-bdb3-14da03925b83","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.506428Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:25f9cabf8c7fea08338e453a722916565ea7c42bc558a4488e8d6a1b24251e00","observation_id":"0db0ec9d-8003-4d08-9186-e582ca2adfaa","resolution":{"observed_at":"2026-08-07T10:29:43.624831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.595070Z","title":"Peeling the onion: Hierarchical reduction of data redundancy for efficient vision transformer training","venue":null,"work_id":"8c0ef6b2-7b7f-45a0-acdf-77de499888f0","year":2023},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.585257Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:9b9dc8c744801800dd0d5ea87872f7256123348e208c856c19c6df62956f6615","observation_id":"a38b61e1-ebe5-4e71-a9c9-425a8547639a","resolution":{"observed_at":"2026-08-07T10:29:43.606625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:05.660989Z","title":"Token reduction should go beyond effi- ciency in generative models–from vision, language to mul- timodality.arXiv preprint arXiv:2505.18227, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.660989Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:97d95bfada654ec81e105550ced8c915e96c80ba4e8a67647171beeb6e46ca5b","observation_id":"45dc1c5f-6e8c-4412-9a90-13b27f30a900","resolution":{"observed_at":"2026-08-07T10:29:05.660989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.569650Z","title":"Mpvit: Multi-path vision transformer for dense prediction","venue":null,"work_id":"4eb34822-93b9-45c9-9cdd-deba6d3425e0","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.744711Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:1e547e9e8e33607c979a2c6fec0449afab4a760894b7d112c7e1391c9d34ceaa","observation_id":"7745153f-5938-43a9-9bcb-ddd347d7c914","resolution":{"observed_at":"2026-08-07T10:29:43.580185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.539411Z","title":"Vidtome: Video token merging for zero-shot video editing","venue":null,"work_id":"540de958-705e-40f9-83e2-e4f48e0e1106","year":2024},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.823630Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:6ced2b1ca3763dbb1be2a043b17dbe799d2630fb26926cc0bfbf846250a3f113","observation_id":"ebd511db-f48c-457c-a81e-9910295f8dfb","resolution":{"observed_at":"2026-08-07T10:29:43.554998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.513798Z","title":"Exploring plain vision transformer backbones for object de- tection","venue":null,"work_id":"77b2a79c-f832-4cca-ac68-6b52791f41a2","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:05.934640Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:a72990115d2bb823449542cda9328f85f3e5a836a7f819472a6cd90855813253","observation_id":"35781d02-da4d-4d47-b89e-e82f19139409","resolution":{"observed_at":"2026-08-07T10:29:43.527097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.489636Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"bf4a95f3-a2ab-444e-a133-d0c87755ecb8","year":2023},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.014456Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:9ca2ef4f4af8b2d1a4cb5ff985faad178f088c838e438b05fd616937146bca26","observation_id":"6f97ca6a-6c2a-441f-bf9b-056cfbe1cec5","resolution":{"observed_at":"2026-08-07T10:29:43.499169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.467240Z","title":"Expediting large-scale vision transformer for dense predic- tion without fine-tuning.Advances in Neural Information Processing Systems, 35:35462–35477, 2022","venue":null,"work_id":"641e062a-5556-4f2e-9b87-87ed0aa43ee6","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.111149Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:71b5e212534ccde0411b32340fbd0b83c821d2b987b6732163f8b7e11c576537","observation_id":"3187dbc6-bf1c-4d47-b63b-1d61bb3e8225","resolution":{"observed_at":"2026-08-07T10:29:43.476808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-03T03:15:29.208149Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-07T10:29:06.229026Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganiza- tions.arXiv preprint arXiv:2202.07800, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.229026Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:49f7010d62d695f5b52f53846e22d69495f5b1abb11b10148d04b939f704efef","observation_id":"4ea22053-9204-4db7-8171-e2f7f4ebb9c3","resolution":{"observed_at":"2026-08-07T10:29:06.229026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:06.305116Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.305116Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:7de3076bca9015c213d19f55afe415e91ff0841f3f0a90b43de9510a4f0d5e81","observation_id":"12b87abb-f5f7-4210-b8ce-fdacd94047db","resolution":{"observed_at":"2026-08-07T10:29:06.305116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:06.392937Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.392937Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:c2eaa68e7457ff7fe1b37639c945dc96298198f3545b0c85a9bfd6591ecf2b58","observation_id":"43770335-d3c0-455d-ad52-55898dd40e3d","resolution":{"observed_at":"2026-08-07T10:29:06.392937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13802","last_updated":"2023-07-06T10:49:33Z","snapshot_observed_at":"2026-07-06T13:57:05.479235Z","submitted_at":"2022-09-28T03:07:32Z","title":"Adaptive Sparse ViT: Towards Learnable Adaptive Token Pruning by Fully Exploiting Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13802","snapshot_observed_at":"2026-08-07T10:29:06.482067Z","title":"Adaptive sparse vit: Towards learnable adaptive token pruning by fully exploiting self-attention.arXiv preprint arXiv:2209.13802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.482067Z"},"links":{"cited_paper":"/paper/2209.13802","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:983bf7204b2485db8f6d992b09dc32176f8e13823f9e3c0c20777e70b374e8c3","observation_id":"860ec1a7-aee1-403f-8680-eb4b3b6ebb18","resolution":{"observed_at":"2026-08-07T10:29:06.482067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:06.552259Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.552259Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:4be2578ff9f945d8f22a853e608ad10f82fd1668b8224fc1fc8f30335b7006ef","observation_id":"33436fba-e7b2-4490-ada3-601545fe07d2","resolution":{"observed_at":"2026-08-07T10:29:06.552259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.414854Z","title":"Beyond attentive tokens: Incorporating to- ken importance and diversity for efficient vision transform- ers","venue":null,"work_id":"ec3919cf-1b62-432f-a080-4527fe32d09c","year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.636831Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:31dbac51cbfc6d8c9d117a700dee9f4febfba771612fd84a95819a21f6e481ad","observation_id":"979a44d9-6da2-46b2-9c21-3b0c8a1f665a","resolution":{"observed_at":"2026-08-07T10:29:43.428964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:06.746497Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.746497Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:c7ab9f41066b05f6e24543e5920f16553b55e2f5db7a30c480dc658ae05ed74b","observation_id":"8009a827-c332-4af3-857d-f6ca9329f6b4","resolution":{"observed_at":"2026-08-07T10:29:06.746497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.267461Z","title":"Importance estimation for neural net- work pruning","venue":null,"work_id":"a54b595c-3673-4089-a61f-951fb6e8c6ca","year":2019},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.834295Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:a7ceac063f837f470a37fd0063170255837d1dad6b728d4bf06a0f0c147b5cc0","observation_id":"2c5cf6f9-377d-48bf-9ce6-902d88ad763e","resolution":{"observed_at":"2026-08-07T10:29:43.391781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:06.910131Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.910131Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:2503285bcab55222ae7a0c68b386090469f02707fbd9355b00f831a50f46fd1f","observation_id":"389c33d8-09c4-43d5-8a3d-b274e8ee555d","resolution":{"observed_at":"2026-08-07T10:29:06.910131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:43.069749Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":"386932cb-4277-401a-8bbd-7b74f6abbcce","year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.981966Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:35dfcaf4dd9b95ed81eb173189ea5f5cf5489ac3c9ec8ee91fed3f5775a1618a","observation_id":"be14cf72-3f22-4df1-aa32-85e1491bf8af","resolution":{"observed_at":"2026-08-07T10:29:43.130693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.068786Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification.Advances in neural information processing systems, 34:13937–13949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.068786Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:9e91903bc8e79be182478fd392897839ce774f813e19f1e79c89ee48dcded144","observation_id":"bd498842-e345-4559-80c2-2c70f62f00f0","resolution":{"observed_at":"2026-08-07T10:29:07.068786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:42.920008Z","title":"Beyond fixa- tion: Dynamic window visual transformer","venue":null,"work_id":"9cc4e993-1003-4034-90b4-fb4c261ca782","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.153073Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:b99d547ec06bf2758271c91910c041004f2da493d8b50323aa9c922df39ae993","observation_id":"c4914461-08cc-4b41-aa12-1558c457f3b5","resolution":{"observed_at":"2026-08-07T10:29:42.989923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:42.809464Z","title":"Tokenlearner: Adaptive space-time tokenization for videos.Advances in Neural In- formation Processing Systems, 34:12786–12797, 2021","venue":null,"work_id":"dc56ce79-a603-4f17-b9d1-0fe25f70adc7","year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.225649Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:194377800dca14227ae728e35e413fead3729fba1d9f4eacaff7a6049544e72a","observation_id":"c15a2e28-18e9-45f3-b269-8df503a92712","resolution":{"observed_at":"2026-08-07T10:29:42.845527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.294589Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models.arXiv preprint arXiv:2403.15388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.294589Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:000778ac29aa5517d8ed85322f7c5c2e800fdc6e36131b325d6fcab632b014c6","observation_id":"599cf5bd-dd11-4724-8683-bef66c8ba766","resolution":{"observed_at":"2026-08-07T10:29:07.294589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.373418Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.373418Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:cfc1b99fb69767353e6336c67788310ba8835a025213220500568dbefa3460d8","observation_id":"0c617dbe-ca68-4420-8bfa-56e394ba68d8","resolution":{"observed_at":"2026-08-07T10:29:07.373418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.438068Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.438068Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:0a80529e90bc15d67381c9f7fec0eb728134bf39531e44469956974f20fffd4f","observation_id":"f38efc45-34f6-4c89-9451-0a85d54ac8b4","resolution":{"observed_at":"2026-08-07T10:29:07.438068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:42.664138Z","title":"How to train your vit? data, augmentation, and regularization in vision transformers","venue":null,"work_id":"9bdaedcd-2f6b-468d-9ea3-d2974e292539","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.536108Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:6db7c5c3d25b27334271bcc72528bde6699a31af207a22e51867c1a931720ae4","observation_id":"dc0e95be-ffb6-4161-bdbf-bf987a02c641","resolution":{"observed_at":"2026-08-07T10:29:42.738363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.626801Z","title":"Segmenter: Transformer for semantic segmenta- tion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.626801Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:cf139813222aa459a1c435a0ebf27622d0b45d9650a9f448e4cc94cf1e69e56e","observation_id":"180647af-62ad-4a1c-a0c8-5fd678508398","resolution":{"observed_at":"2026-08-07T10:29:07.626801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.694796Z","title":"Chip: Channel independence- based pruning for compact neural networks.Advances in Neural Information Processing Systems, 34:24604–24616,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.694796Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:3ba97bfe1969a2da6dc1e1fca4ac31089aa6230f2596e48c8d303a80d124b8df","observation_id":"3bf620c2-ed9e-41c9-9bb4-b3d7605a99f3","resolution":{"observed_at":"2026-08-07T10:29:07.694796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:42.519671Z","title":"Revisiting unreasonable effectiveness of data in deep learning era","venue":null,"work_id":"30a366e7-4edc-467e-ad38-e0a828d5f34c","year":2017},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.784186Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:c9f014242f555248b2b2fdacb961f577b0973e5475c41c05726f0d08882fc327","observation_id":"665c0120-0de5-4f2f-b165-53a8a84b86ed","resolution":{"observed_at":"2026-08-07T10:29:42.560510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:11.118397Z","title":"Patch slimming for ef- ficient vision transformers","venue":null,"work_id":"80b194fb-7959-45b0-939a-06bf7d8d4ae2","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.843474Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:cb4ab7fd178d3058b149ecc2f17c5373afacf0642340249995503aaa044c0dcf","observation_id":"7642238b-05ad-4b54-95bd-5a92d8873de0","resolution":{"observed_at":"2026-08-07T10:29:42.468333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.987098Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"b96c0c3b-eb89-4a02-ab93-fb6bddb4a36f","year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.913513Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:6e3528058d854e8b748531a14a28faff349768a299713f0ba537bc88c3d9a0d1","observation_id":"63b54ada-a354-421e-8569-7910f6534099","resolution":{"observed_at":"2026-08-07T10:29:11.049320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:07.974529Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:07.974529Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:21859366154cff8e0eaf04fcabdd2d8dddeff38dee798b1ea2834a4fe5df943f","observation_id":"e790d5cb-ccf1-4974-9c54-65424d8265f7","resolution":{"observed_at":"2026-08-07T10:29:07.974529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.832487Z","title":"Not all images are worth 16x16 words: Dynamic transformers for efficient image recognition.Advances in Neural Information Processing Systems, 34:11960–11973,","venue":null,"work_id":"e819a1a7-9e50-48c2-8ae8-59a6043603a9","year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.053653Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:3622d4020e9a3b970bfe16c75d6e4704346d2775f51990258b7af5af62dbf066","observation_id":"6265c65b-848b-463c-846e-00f2bf5bfa08","resolution":{"observed_at":"2026-08-07T10:29:10.912369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.656451Z","title":"Qsfm: Model pruning based on quantified similarity between feature maps for ai on edge.IEEE Internet of Things Journal, 9(23):24506–24515,","venue":null,"work_id":"46ed4105-f35f-45a2-8fde-2dd59c0e0425","year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.136865Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:1e716d1df7a6044538e2a7ea1995407c79a8a9ebb2ea55749689adf222dd3be3","observation_id":"040418a6-dfae-4977-97f0-68ce49ba74f6","resolution":{"observed_at":"2026-08-07T10:29:10.741796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.503836Z","title":"Joint token pruning and squeezing towards more aggressive compression of vision transformers","venue":null,"work_id":"8a4ee99b-6a6d-4adb-9fd4-27aecfbaf8f2","year":2023},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.203119Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:fff2f0e65289ff855612d1cb4da03759f8e497d16db24a3cba9abc02df9f38ff","observation_id":"63559539-8457-4376-a2e8-b9030fb3dafa","resolution":{"observed_at":"2026-08-07T10:29:10.586451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01812","last_updated":"2024-02-05T09:21:28Z","snapshot_observed_at":"2026-07-06T16:26:58.234941Z","submitted_at":"2023-10-03T05:55:11Z","title":"PPT: Token Pruning and Pooling for Efficient Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01812","snapshot_observed_at":"2026-08-07T10:29:08.280794Z","title":"Ppt: Token pruning and pooling for efficient vision transformers.arXiv preprint arXiv:2310.01812, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.280794Z"},"links":{"cited_paper":"/paper/2310.01812","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:3c1579188e9a6eed6934c32e828bab85c0ee444c642f9d9c9785a720f69eac9a","observation_id":"32e2e7f0-0d15-4941-a2d5-1f0e6db7e66d","resolution":{"observed_at":"2026-08-07T10:29:08.280794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.347547Z","title":"Evo-vit: Slow-fast token evolution for dynamic vision transformer","venue":null,"work_id":"cfbbc6ff-c2f6-4774-b6c7-1d23c7a53418","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.344854Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:07f4c7cfc586ecb0d309501d8d35d52961e4e70fdfadf9ac17c0105078027e6b","observation_id":"eca5658d-1943-4dc2-8b1a-8f62dab531a8","resolution":{"observed_at":"2026-08-07T10:29:10.423172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.195329Z","title":"Global vision transformer pruning with hessian-aware saliency","venue":null,"work_id":"eaca0faa-47b9-4537-8fe2-6adebf6b5b99","year":2023},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.423711Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:3075b7fa016b8a4f92124af864528776654bde409ff7a8cff6ecc3ee3392ab35","observation_id":"72664a1a-4b25-4c08-bda6-24766bf60a3e","resolution":{"observed_at":"2026-08-07T10:29:10.254561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:10.068471Z","title":"A-vit: Adaptive tokens for efficient vision transformer","venue":null,"work_id":"34518172-d9d4-4097-af81-6b4b5f2afd65","year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.504518Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:9cc98813bf3fd41d7847e7c647c583ab5e36285f5e73c7f1c11ccf4cd011a793","observation_id":"7c47a347-b9f8-4c80-99c0-4ebe1b3fd104","resolution":{"observed_at":"2026-08-07T10:29:10.129384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:09.955464Z","title":"Tokens-to-token vit: Training vision transformers from scratch on imagenet","venue":null,"work_id":"719efc1c-5814-487a-95dd-6c166123529b","year":null},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.575250Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:bbdf05b6153b9bce79622653805caeba17769f27c3127da9ab3555d4cda48402","observation_id":"63afa598-10e5-4f57-88f8-492bde008644","resolution":{"observed_at":"2026-08-07T10:29:10.005623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:08.661650Z","title":"Vision trans- former with progressive sampling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.661650Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:970be4710c62eee29a3c6ad41ad5298bb510be015faef247889dc7d1ccb22bd5","observation_id":"2e68c206-74c2-4a0f-8819-3c2255aeadc6","resolution":{"observed_at":"2026-08-07T10:29:08.661650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:09.814452Z","title":"M2m-tag: Training-free many- to-many token aggregation for vision transformer accelera- tion","venue":null,"work_id":"2db7f96b-5771-462d-86e6-e2fe519204b2","year":2024},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.730983Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:182966b1adf1eac33eda10b40362a7197aa5f1d004d059a3a1cf9d8eac875f5a","observation_id":"a6d25efe-71d6-421f-a3f2-91d162418698","resolution":{"observed_at":"2026-08-07T10:29:09.878326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:08.831348Z","title":"Parameter efficient merging for multimodal large language models with complementary parameter adaptation.arXiv preprint arXiv:2502.17159, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:08.831348Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:f39833d14f2d315487cb26c2962b04d2fbae44334004c66056f1d643e8b2f380","observation_id":"26b79f09-84bc-4d47-93d4-63977eb608fd","resolution":{"observed_at":"2026-08-07T10:29:08.831348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-07T10:29:09.058019Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection.arXiv preprint arXiv:2203.03605, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:09.058019Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:a80f8542e9bc4a7cdb9631d1e3aeb03d88a8cd31ccf3dd248e29b916663de46a","observation_id":"826c9cc8-af54-414b-8c2e-909cd64c8e08","resolution":{"observed_at":"2026-08-07T10:29:09.058019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:29:09.682550Z","title":"Semantic under- standing of scenes through the ade20k dataset.International Journal of Computer Vision, 127:302–321, 2019","venue":null,"work_id":"4daf8dc8-ea0f-448b-8ce4-b720577a3c76","year":2019},"citing_paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:09.281677Z"},"links":{"citing_paper":"/paper/2506.05709"},"observation_digest":"sha256:0c47fffdfb4d4bb88eabf72239aac7a41eca38b4ffef84b6db8807cf34238749","observation_id":"9079dc22-0f25-4fa9-87b7-94dd8acfa084","resolution":{"observed_at":"2026-08-07T10:29:09.750518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05709","last_updated":"2025-06-06T03:18:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:47:35.907380Z","submitted_at":"2025-06-06T03:18:11Z","title":"Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 3 inbound Pith citation observations for arXiv:2506.05709."}