{"as_of":"2026-08-09T07:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2bcf752d47ab040aa9a39867c63eda4ea9ac2cda69745779dd1c44d42d116937","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:22:31.335412Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.05718/citation-record","integrity":"/paper/2604.05718/integrity","json":"/paper/2604.05718/citation-record.json","paper":"/paper/2604.05718"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token cropr: Faster vits for quite a few tasks","venue":null,"work_id":"8f3bdbf4-0bf1-4d98-a5ef-e39bafe76528","year":2025},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:532b950158bfd93866c9a36c1f8ff4ca1a83784a70ad68d8fc05617af80cff4b","observation_id":"6fa920ec-9477-42ed-952d-bd0a83c9717d","resolution":{"observed_at":"2026-05-16T05:37:25.202465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token merging: Your vit but faster","venue":null,"work_id":"e9ce772c-28c2-47ad-a3ac-a4bea2bb446c","year":2023},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:5b1835ad3ccaadf3ec7267705e9e87866b1a2ccf4bb84ad9791113b0beec547e","observation_id":"02c0aaaf-23d6-40db-81a4-726c3e0c9335","resolution":{"observed_at":"2026-05-16T05:37:25.195120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision transformer adapter for dense predictions","venue":null,"work_id":"0cf83e0f-7c9b-4167-a57f-3af8337fc67b","year":2023},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:94e818e36b27ef9cc85614728dea365d87252ba5dde5351b8773f0a70d8a52ec","observation_id":"caed3035-6d8f-4af7-a97e-f7e476ae1e9b","resolution":{"observed_at":"2026-05-16T05:37:25.210193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Schwing, Alexan- der Kirillov, and Rohit Girdhar","venue":null,"work_id":"3687301f-1f89-440a-b46a-062ac769085d","year":2022},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:75983f4674b7cec39ac291c9549802ae2d916f6d1a5093fc70babf65c6443c27","observation_id":"072c1706-ca38-4bf3-85c8-60de95af8ead","resolution":{"observed_at":"2026-05-16T05:37:25.198616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1, 2, 7, 8","venue":null,"work_id":"890f0026-bc66-4ec9-a38a-20723435b72f","year":2022},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:aa066a77592798b2f94c1b433ffb6c14713fb0e477f32868d1ea4bbfc5bb658b","observation_id":"43ae2f76-acc0-48c0-9cfc-71301ca98cf5","resolution":{"observed_at":"2026-05-16T05:37:25.206217Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention-2: Faster attention with better paral- lelism and work partitioning","venue":null,"work_id":"a10d56f2-8e4c-4869-b172-662468338762","year":2024},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:a8687da734f6073b4b4ecf9b2599a2ba93a7babcdca9c8f5b85ea44df38972b5","observation_id":"3a216b39-ff84-4e1c-9b82-b5066dcb9dcd","resolution":{"observed_at":"2026-05-16T05:37:25.220584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R´e","venue":null,"work_id":"1b095b16-c2b0-49f4-8815-4ddecd297fef","year":2022},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:600223824d5aba446e8255419d7e015fbb81e30d4723bd14e50779d4c7ab4e65","observation_id":"01f7cf07-61a2-4553-a6b7-6769144b709a","resolution":{"observed_at":"2026-05-16T05:37:25.213855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"f7d718d2-57b1-421c-af8b-93e5ed7305c1","year":2021},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:b38abbf05e092165eeeb1680013049d5e2c5176f9ef02e2ae720cf7e5b596e44","observation_id":"8b6a5413-8416-4b3d-9fa6-df2446c689ba","resolution":{"observed_at":"2026-05-16T05:32:24.791485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multiscale vision transformers","venue":null,"work_id":"e7f95b7f-8340-4970-8671-5d93dafa691a","year":2021},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:707bee85df39cf3cb6e09c4959e402b69fe2d1392a79191b5729069b3ef20301","observation_id":"a4a7177d-2706-4907-8292-f2e003bfc59a","resolution":{"observed_at":"2026-05-16T05:32:24.750268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EV A: exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"bbf94c00-7ebe-4321-8137-7d07c53e27f1","year":2023},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:633644a4046f790fb09c258612b23a9e77a562a69c9a4d333d8826c8b2696d36","observation_id":"c90e54dd-10da-49c2-8aee-65679c1a1271","resolution":{"observed_at":"2026-05-16T05:32:24.823500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive token sampling for efficient vision transformers","venue":null,"work_id":"fa45affc-6e4d-46e8-959e-a40b3dfb4b99","year":2022},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:7088609093f7019f57ce89f5143b00f6c8676bc350c92bf25d741f52c9f9fe0d","observation_id":"0c63f0c3-7592-41d4-9c72-7f278ccc1fd9","resolution":{"observed_at":"2026-05-16T05:32:24.799332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tay- lor, and Thomas B","venue":null,"work_id":"eb4fb68b-01b7-41b4-aae2-8d9d4758168d","year":2024},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:ab7a1028a4fb5e53eb01d41b058e55787a0cc4e3393813e00299e6a3decf781a","observation_id":"058150ba-ff26-4f85-98a0-0ac19cfe3080","resolution":{"observed_at":"2026-05-16T05:32:24.806898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token fusion: Bridging the gap between token pruning and token merging","venue":null,"work_id":"86241b84-fc5a-4088-bda9-6716b15a31d5","year":2024},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:e33dd8256c5c15846e6ecd7108d48ebeeaa7528799663e9d99d519dfd169c375","observation_id":"38dabb03-8826-4522-8116-39bc22f14534","resolution":{"observed_at":"2026-05-16T05:32:24.795342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spvit: Enabling faster vision transformers via latency-aware soft token pruning","venue":null,"work_id":"407588bb-5838-4839-926b-685ec2189657","year":2022},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:a90729913a56e04de5e1609b86f0145751b0a3fc6f751dcdb807f12fa1b6f19f","observation_id":"6931de52-37f4-4674-a06b-dc47316dd666","resolution":{"observed_at":"2026-05-16T05:32:24.803305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to merge to- kens via decoupled embedding for efficient vision transform- ers","venue":null,"work_id":"bd3c27a0-f24a-4e8f-8caa-1d4280e7ffc3","year":2024},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:0b78b7a5d07577d87cbf7013c0e7ce82f98dea3a148c140e775fda9a04e04af1","observation_id":"c1aee6d8-be27-4a9f-9af9-466acd30574e","resolution":{"observed_at":"2026-05-16T05:32:24.814832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expediting large-scale vision transformer for dense prediction without fine-tuning","venue":null,"work_id":"6e287f15-c048-4382-8848-0ffbf1d20cd8","year":2022},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:0386f037db423a97c29ef088567265605a04763e2e94578d00d5d6a1db7270de","observation_id":"5f2bcf02-845d-486e-b778-a2eed40ea902","resolution":{"observed_at":"2026-05-16T05:37:25.185077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evit: Expediting vision transformers via token reorganizations","venue":null,"work_id":"1c55a1bf-8c3d-47c4-8072-05538af08817","year":2022},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:9e3275ba878bc952e65d2f70f77144b74e69b81e41f970e13a7b41754a453786","observation_id":"491a05dc-61bf-4561-8844-ac440092a054","resolution":{"observed_at":"2026-05-16T05:37:25.176971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive sparse vit: Towards learnable adaptive token pruning by fully exploiting self-attention","venue":null,"work_id":"96ccf567-4cef-4a13-9180-64ed1e57ee87","year":2023},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:b4314e92abff4d1aae8d65098460c3335c84ccc56d0eec9b5adcbd5fe91588bd","observation_id":"e26ca4c4-2e3f-4374-a5cb-b96942a2631e","resolution":{"observed_at":"2026-05-16T05:32:24.787632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"716e196d-9b3a-48c5-b61f-2c4f324c940c","year":2021},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:49373d7126a0d134fe41dac6b3b5b4cf8f769245e95789be70d4865ee9beb452","observation_id":"2320bb68-1507-4e61-8f29-faa7df4525d9","resolution":{"observed_at":"2026-05-16T05:32:24.728597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Content- aware token sharing for efficient semantic segmentation with vision transformers","venue":null,"work_id":"564809e3-4738-4e62-9806-e805ec34e8ac","year":2023},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:4796094776a7ece8291f9944446ad9820bf60df1e225f7098526b2fad7c31dfe","observation_id":"821f12c1-a7ac-4c01-a84a-e7bea43a4fb5","resolution":{"observed_at":"2026-05-16T05:37:25.217144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token pooling in vision transformers for image classification","venue":null,"work_id":"00726efb-0178-49ef-b6a9-6017f0d8c856","year":2023},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:316b7342fbdf20015227c27169312a025c8c80727498e73cd0012925c0021c7d","observation_id":"417517f5-09b1-466e-a2c8-b6b8d61df781","resolution":{"observed_at":"2026-05-16T05:32:24.775632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ALGM: adaptive local-then-global token merg- ing for efficient semantic segmentation with plain vision trans- formers","venue":null,"work_id":"f0f8d169-3c09-43ac-be32-0910f0d3e96a","year":2024},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:0234df40f21f02f3cd5c125fa1d6ffa822c892c520748ce13f63e92a67114cc5","observation_id":"dd2d1b0a-0aa1-4a2c-b884-b35b08712aba","resolution":{"observed_at":"2026-05-16T05:32:24.771677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamicvit: Efficient vision trans- formers with dynamic token sparsification","venue":null,"work_id":"1c730714-79a4-4528-8f08-672357494fd2","year":2021},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:b916618fdafcd193c44e5b7f834f2788c066fa7bd63750dd31af27f5d03d8d5e","observation_id":"4d3d162a-3067-44f3-aa1f-fe879018ba1d","resolution":{"observed_at":"2026-05-16T05:32:24.779818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hiera: A hier- archical vision transformer without the bells-and-whistles","venue":null,"work_id":"41ac7b6d-c7d3-4e45-9724-4689055dafc7","year":2023},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:64c3b899208232afa918e48bc67f79603886f3f9d74f11c4f4a379cb3d3a9ecd","observation_id":"aa05c928-19e2-4cf5-89ad-df37e440dd50","resolution":{"observed_at":"2026-05-16T05:32:24.819163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"46082a2c-d620-485d-9582-0277457c46c4","year":2021},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:670809a8affecf49bb430207009b220d62fc20c71fc4ee00c29fd97937c17adb","observation_id":"e7733b8f-ab35-472e-b4df-a666b5485f13","resolution":{"observed_at":"2026-05-16T05:32:24.783802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision","venue":null,"work_id":"db827d33-dc38-4801-aea5-429b04245086","year":2024},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:f4c6ac4641739724fa801af2abefc0986f50529c6ff197c8b0f8467859374db1","observation_id":"39769017-af61-4bfc-8503-3de25ab8ce32","resolution":{"observed_at":"2026-05-16T05:32:24.759045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segmenter: Transformer for semantic segmentation","venue":null,"work_id":"896d4d46-23c8-49df-a0a3-7f88a7c9f660","year":2021},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:2e1aee79ebaac06570b84865d22030a7e73bf4308cfd6c1b694b496c04273a6b","observation_id":"1f6ae0e3-9915-4a28-bfef-30ba7b76949c","resolution":{"observed_at":"2026-05-16T05:37:25.173721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"8e73c345-92ea-45ce-a9ee-f79bdb06bf93","year":2021},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:a09a7579554cf19bb70ab7827c1bad88c0834788e24b18dfbec4fc7abb3db6da","observation_id":"ccacf9b4-2062-49c9-99c5-e1288efb615f","resolution":{"observed_at":"2026-05-16T05:32:24.754490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"3e4acbc1-dd74-4fb7-bc8e-0b2c0527b00c","year":2017},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:92564ddd0a45dc79d5b7a0eb4e34ee4d6b29cc97fb436172bfbbd28e54c6604b","observation_id":"406ce45b-bc89-4971-a540-e33c1a33df4b","resolution":{"observed_at":"2026-05-16T05:37:25.191811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pyra- mid vision transformer: A versatile backbone for dense predic- tion without convolutions","venue":null,"work_id":"7fea3f14-3e0d-4d25-acef-dfc4f2f7cee8","year":2021},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:3ca2d622589071734589522f47936d4ea95c940854f5ba2e0fc6d97e2ff43a87","observation_id":"b4eef831-c912-4d3e-ad32-6eb3e53c9525","resolution":{"observed_at":"2026-05-16T05:32:24.767765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PVT v2: Improved baselines with pyramid vision transformer","venue":null,"work_id":"77a8f7a4-b2e5-4107-86a8-a241ea901aac","year":2022},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:98f391f1e79a33ac63fbf95272270ac4d3fa01363cf10da91e1ae28899066814","observation_id":"c579ccfc-cae9-4aa3-9be6-ca00fc3813c1","resolution":{"observed_at":"2026-05-16T05:32:24.763262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dtmformer: Dynamic token merging for boosting transformer-based medical image seg- mentation","venue":null,"work_id":"5c28fefc-1006-4c51-b139-3744f23ecb92","year":2024},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:160aaeec5306bd3d55182584a7bc00f4ec7bdf4e6e6cc90f6e5b45a15e0c07eb","observation_id":"26a06763-d81d-4171-8e3b-fbc2ea158585","resolution":{"observed_at":"2026-05-16T05:37:25.188735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01812","last_updated":"2024-02-05T09:21:28Z","snapshot_observed_at":"2026-07-06T16:26:58.234941Z","submitted_at":"2023-10-03T05:55:11Z","title":"PPT: Token Pruning and Pooling for Efficient Vision Transformers","version":3},"cited_work":{"arxiv_id":"2310.01812","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.01812","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ppt: Token pruning and pooling for efficient vision transformers","venue":null,"work_id":"4a42f70b-32c8-4a4d-8569-bea304b319e5","year":2023},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"cited_paper":"/paper/2310.01812","citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:ffbfcceddbf79bad0af5755aef1bcfbf21ca5d87df791efca63ea26a73e92e20","observation_id":"4b47a9aa-e219-43d3-876d-13a4de100c7b","resolution":{"observed_at":"2026-05-10T23:05:47.985985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified perceptual parsing for scene understanding","venue":null,"work_id":"27bd9a6d-7f52-4136-93d8-0f2d516b56b5","year":2018},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:80dd5d24349951486092ad626e3a8fa5aafd9a8cecf2cfb7ad9a95e0e066906f","observation_id":"bc2c3069-bff8-42b1-b352-067a28db6c62","resolution":{"observed_at":"2026-05-16T05:32:24.810969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"´Alvarez, and Ping Luo","venue":null,"work_id":"18c848c4-b45a-4162-837f-41447fdbf707","year":2021},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:35c33cb67893ea84d634020bff7a5091b80f62da47e4814a9a19b6b16bb84b3a","observation_id":"537d0504-9ce9-4e9e-9866-6d2fe3bdd01c","resolution":{"observed_at":"2026-05-16T05:32:24.740691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evo-vit: Slow-fast token evolution for dynamic vision transformer","venue":null,"work_id":"e14383c2-548b-4596-bc2b-178e57c73c41","year":2022},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:65899dc5bd991515f711825b83b0ac3996f8412d4f502e09320bbae70530e76b","observation_id":"2b8e1192-c2f9-4809-8184-eaf8f155bd23","resolution":{"observed_at":"2026-05-16T05:32:24.745477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"´Alvarez, Arun Mallya, Jan Kautz, and Pavlo Molchanov","venue":null,"work_id":"28e0da03-a779-4f29-856d-6028f54b00b9","year":2022},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:56e29dc152d25fc21b93ea8897df7f1c299d0b383fac2323af4040fc4d779d8a","observation_id":"35d7fcad-3bce-4fd3-8aa5-8f6ef6a38afe","resolution":{"observed_at":"2026-05-16T05:32:24.736287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segvit: Semantic segmentation with plain vision transformers","venue":null,"work_id":"212661f0-552e-48df-a29f-3bc93c1b5aab","year":2022},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:17cd289457f72158a90460b5cc649ddb6c6500a7b0b8f21eb8f2271d60b4c506","observation_id":"c655f3f5-72b9-4dde-94f1-d662c847bd9a","resolution":{"observed_at":"2026-05-16T05:37:25.181166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene parsing through ADE20K dataset","venue":null,"work_id":"a002a308-6df3-45d3-98d5-63640e1c2a93","year":2017},"citing_paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T19:22:31.335412Z"},"links":{"citing_paper":"/paper/2604.05718"},"observation_digest":"sha256:c63056aeac633103dfb36ac9d64da2e19bb2b4389b491ccbba615bb8b2870c34","observation_id":"ecfb700a-08a4-4b6f-9438-8b2d375068a4","resolution":{"observed_at":"2026-05-16T05:32:24.732396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.05718","last_updated":"2026-04-07T11:16:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:16:18Z","title":"MPM: Mutual Pair Merging for Efficient Vision Transformers"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":1,"verified_exact":1,"verified_fuzzy":36},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2604.05718."}