{"as_of":"2026-08-11T20:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30ba75bc426661726cbcb0476cbc491fb60b8597ef84f4a61112f6f4f37d0f91","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:58:30.392727Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.00243/citation-record","integrity":"/paper/2501.00243/integrity","json":"/paper/2501.00243/citation-record.json","paper":"/paper/2501.00243"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.925334Z","title":"Fine-Grained Image Analysis with Deep Learning: A Survey,","venue":null,"work_id":"695a28aa-05c4-416c-afb6-110e6e034292","year":2021},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.602901Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:39f753c088b3dcf9a03a1ce029f6c9fc11de8ee8654a231fe1fc28b3a668edb2","observation_id":"2d24d45b-3a27-41dc-aac6-46bdf4cc686a","resolution":{"observed_at":"2026-08-10T22:58:31.928810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.915782Z","title":"Benchmark Platform for Ultra-Fine-Grained Visual Categorization Beyond Human Perfor- mance,","venue":null,"work_id":"94d58ce6-d972-45c0-a183-62cb9119b8aa","year":2021},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.643864Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:be152a7542cc8156421cebd3c763b8fea281bcc00b9a3ee0487b209ebc36d62a","observation_id":"294a2ddd-381e-43b3-813c-75247f56b505","resolution":{"observed_at":"2026-08-10T22:58:31.919057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.886246Z","title":"The Image Data and Backbone in Weakly Supervised Fine-Grained Visual Categoriza- tion: A Revisit and Further Thinking,","venue":null,"work_id":"1ae66721-7460-4ecf-aca3-b00991a8d204","year":2024},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.688486Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:441ddcbbcd24f60f8db49b2fc5099e1ec026470c8b7207c1fb479afa2b04db00","observation_id":"5882f9e3-b464-4db1-82a5-c9433ef38b00","resolution":{"observed_at":"2026-08-10T22:58:31.909365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T22:58:29.752129Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.752129Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:e8aea86b77f731aa1cab3caa122e462f69a651a2aeaafabf803a9810f394ce49","observation_id":"373ccfd6-2c37-4037-8ac3-73eccf67c7b3","resolution":{"observed_at":"2026-08-10T22:58:29.752129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.813997Z","title":"TransFG: A Transformer Architecture for Fine-Grained Recognition,","venue":null,"work_id":"13e57416-adb0-4ab3-955b-538c500654c1","year":2022},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.811454Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:ccafa759f0563f9a956c746bce2d9581f3f96274d06b56fce3964e1c1194eb2d","observation_id":"4b341ac1-497b-4d61-b600-3f62a5496728","resolution":{"observed_at":"2026-08-10T22:58:31.836250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02341","last_updated":"2022-02-28T20:31:54Z","snapshot_observed_at":"2026-08-07T00:23:56.661090Z","submitted_at":"2021-07-06T01:48:43Z","title":"Feature Fusion Vision Transformer for Fine-Grained Visual Categorization","version":3},"cited_work":{"arxiv_id":"2107.02341","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.02341","snapshot_observed_at":"2026-08-10T22:58:30.515509Z","title":"Feature Fusion Vision Transformer for Fine-Grained Visual Categorization","venue":"cs.CV","work_id":"cece6e40-a0a7-42a6-b5c0-3f505fb45513","year":2021},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.816111Z"},"links":{"cited_paper":"/paper/2107.02341","citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:1e737b3a4a42ebb804ea18443bddf74bb89545ab3ed520731605326c19934e43","observation_id":"102a6b76-9d12-4497-90bf-ab06d79ae1ce","resolution":{"observed_at":"2026-08-10T22:58:30.567875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-08-10T11:20:26.295031Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-10T22:58:29.821088Z","title":"Quantifying Attention Flow in Transform- ers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.821088Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:7c881872558b97a91b13d5fd966c0387412a7ab8f6f61e18c9a9e5c48e6c2025","observation_id":"b6cda2e1-20ac-45f0-9b9e-8a3373daed1c","resolution":{"observed_at":"2026-08-10T22:58:29.821088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.747678Z","title":"Efficient Fine- Grained Object Recognition in High-Resolution Remote Sensing Images From Knowledge Distillation to Filter Grafting,","venue":null,"work_id":"a2eda798-311f-44c9-a43a-ff1430dbb52c","year":2023},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.825035Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:9e73e285fdc5e5ccfecc079c0cbe5103b965844b4f74000000dea91188b5a6d9","observation_id":"e3c73ed4-5e80-4a94-99e2-87537c881907","resolution":{"observed_at":"2026-08-10T22:58:31.752834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.736358Z","title":"Fine- Grained Ship Detection in High-Resolution Satellite Images With Shape- Aware Feature Learning,","venue":null,"work_id":"1dbea49e-3ddc-4759-8e71-fd03a8cdc2ad","year":1914},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.829978Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:7420cf0b0c8f29c276e867a6deea3cf5a60a16ed8da8dd50d25b258cbdeae69e","observation_id":"b0aa068e-a423-48ab-a05c-5081e4334a59","resolution":{"observed_at":"2026-08-10T22:58:31.740746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.724574Z","title":"DynamicViT: Efficient Vision Transformers with Dynamic Token Sparsification,","venue":null,"work_id":"8a3f4450-e835-498c-9bb9-5f238adc1bac","year":2021},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.834382Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:41eebb545fdc23883b98e0223bdb1b6402440c127d51a83db850d601cd97bddd","observation_id":"13bf8432-5d1d-4140-ad45-a9f07fcb8930","resolution":{"observed_at":"2026-08-10T22:58:31.729198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15667","last_updated":"2022-07-26T17:54:59Z","snapshot_observed_at":"2026-08-06T07:00:18.383728Z","submitted_at":"2021-11-30T18:56:57Z","title":"Adaptive Token Sampling For Efficient Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15667","snapshot_observed_at":"2026-08-10T22:58:29.838599Z","title":"Adaptive Token Sampling For Efficient Vision Transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.838599Z"},"links":{"cited_paper":"/paper/2111.15667","citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:a99387af9034d84336888305154a38b1a1b167dbf74e2447a9a03871b277ff9f","observation_id":"6e3787d5-9542-431b-a4c7-077c11b09f77","resolution":{"observed_at":"2026-08-10T22:58:29.838599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12015","last_updated":"2022-02-24T10:56:17Z","snapshot_observed_at":"2026-08-10T20:42:59.819754Z","submitted_at":"2022-02-24T10:56:17Z","title":"Learning to Merge Tokens in Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12015","snapshot_observed_at":"2026-08-10T22:58:29.860345Z","title":"Learning to Merge Tokens in Vision Transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.860345Z"},"links":{"cited_paper":"/paper/2202.12015","citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:f58e6746cdcee02df71035ad58c610354c84a6f632fe1e46a08d52648a3de2d3","observation_id":"e154e3af-75d3-4c8d-8666-840f1a9efd05","resolution":{"observed_at":"2026-08-10T22:58:29.860345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-10T22:58:29.900662Z","title":"Token Merging: Your ViT But Faster,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.900662Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:6087708e18232831b412be60278d4c167148d6a4f9543c5041445857ea58772d","observation_id":"dc181bac-c3fb-485d-a2e5-f4cb624f70fd","resolution":{"observed_at":"2026-08-10T22:58:29.900662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.706931Z","title":"Patch Slimming for Efficient Vision Transformers,","venue":null,"work_id":"3558deb9-19a9-45b8-96b9-eba4d4c905a9","year":2022},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:29.964039Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:0c7a9251a5089a0050f96747897893ae23cfc0ba7a1998ae12a0627b46bde32f","observation_id":"5f71677b-713f-4fb1-8de2-5202de986aa3","resolution":{"observed_at":"2026-08-10T22:58:31.716716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.597928Z","title":"EViT: Expediting Vision Transformers via Token Reorganizations,","venue":null,"work_id":"07aeb359-9fcb-42e9-bbf5-648cff91efe7","year":2021},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.013072Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:86c19e977e77f153c44fedd8c9f81982f69403f8988ed48f0e82ea4622d25744","observation_id":"e93142a7-2d48-47ff-ab46-8c7f7ba1091d","resolution":{"observed_at":"2026-08-10T22:58:31.690957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.489622Z","title":"Self- slimmed Vision Transformer,","venue":null,"work_id":"d6badddc-0c6d-4d78-ba4e-ceb3791c0a06","year":2022},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.069175Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:41e8452f4e88efb0f3f9f5385ba5e28497c81651738b1b1a908ea82f3444660d","observation_id":"27c368ee-1798-48d0-ac9e-8456dfe66166","resolution":{"observed_at":"2026-08-10T22:58:31.527345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07118","last_updated":"2022-04-14T17:13:44Z","snapshot_observed_at":"2026-08-10T10:11:29.642432Z","submitted_at":"2022-04-14T17:13:44Z","title":"DeiT III: Revenge of the ViT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07118","snapshot_observed_at":"2026-08-10T22:58:30.111426Z","title":"DeiT III: Revenge of the ViT,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.111426Z"},"links":{"cited_paper":"/paper/2204.07118","citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:0e22345c5f83cca0dd407cfbf3d025b66d7d73356a2e0999b233843fb976d3a7","observation_id":"17f86b3a-76d2-4037-b76c-db77ada7f836","resolution":{"observed_at":"2026-08-10T22:58:30.111426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.476152Z","title":"Learning Contrastive Self- Distillation for Ultra-Fine-Grained Visual Categorization Targeting Lim- ited Samples,","venue":null,"work_id":"4943d23d-adeb-430f-b659-8cb0b94ff13b","year":2024},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.116000Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:9a408eb570888ae35c95aaecb9785910502f7860b00b5611c462a51d53a9e17b","observation_id":"34fe6597-cd90-409d-9498-34b8e2f6e703","resolution":{"observed_at":"2026-08-10T22:58:31.480991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.427929Z","title":"Not All Tokens Are Equal: Human-centric Visual Analysis via Token Clustering Transformer,","venue":null,"work_id":"cd6a32e0-2c02-460e-98a7-744396004b23","year":2022},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.120581Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:f2a3c9636a25b47cdf3d00c08898494674da14acb5dfd7ca447bf549700af661","observation_id":"0967f74e-855c-4f54-82ec-9a6db93633e5","resolution":{"observed_at":"2026-08-10T22:58:31.466794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.244591Z","title":"Vision Transformers Need Registers,","venue":null,"work_id":"411faf2d-315f-4731-a594-0e7b4984478b","year":2023},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.124007Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:c535a744f319b44e09afc7ba195a92b545bbbf62e2930d1a6d9f834726581294","observation_id":"1d3e80a2-8ee5-497e-83da-2c81ac9749ce","resolution":{"observed_at":"2026-08-10T22:58:31.292593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.130358Z","title":"SIM-Trans: Structure Information Model- ing Transformer for Fine-grained Visual Categorization,","venue":null,"work_id":"f4404b0e-b7f6-486c-840b-d8b1e4e29d93","year":2022},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.128991Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:5e33cfab3e062e57dfd49c7ae86d69696c9b0845bb533cd49ccdfdcd85b26e20","observation_id":"4c94fc79-9e2e-4946-818b-58ed0d6af82e","resolution":{"observed_at":"2026-08-10T22:58:31.162399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.117408Z","title":"Fair Compar- ison: Quantifying Variance in Results for Fine-Grained Visual Catego- rization,","venue":null,"work_id":"1ce739fd-3f25-40b2-abee-fcc32bbb122d","year":2021},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.132878Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:22765f42adc716719614002d4d937a5c7576ac88b9b90b8fd75a4b59cd5c150b","observation_id":"25c132fe-7418-4c7b-9411-f8c22be2c43c","resolution":{"observed_at":"2026-08-10T22:58:31.121505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-09T03:59:14.830524Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-10T22:58:30.137033Z","title":"Training data-efficient image transformers & distilla- tion through attention,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.137033Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:3488671ac9303fe6a0d01c5f6951daea0dbd3ff624cbbc4b1258dece981297e8","observation_id":"1746af05-c3ca-4bba-957a-89c48a4bd120","resolution":{"observed_at":"2026-08-10T22:58:30.137033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.104687Z","title":"ImageNet-21K Pretraining for the Masses,","venue":null,"work_id":"42db0294-c329-4d3b-b642-a87e421fb1ba","year":2021},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.141659Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:42b28b68219035aeec3ec98d3faf69b44aad68bd40c967d6cf49722113aa2f02","observation_id":"f0a4be45-84cb-48bd-ac4b-05f5080bd0cd","resolution":{"observed_at":"2026-08-10T22:58:31.108925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.092113Z","title":"An Empirical Study of Training Self- Supervised Vision Transformers,","venue":null,"work_id":"1e0221ef-87d6-469d-9636-aa373e37a3a8","year":2021},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.146102Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:1036df61c932d8952efbb950f88236cde73bc7c2d8cf5960c0b4200f411dbc98","observation_id":"5efae1b1-9be7-4e1b-9f0c-bf8fd61c80d3","resolution":{"observed_at":"2026-08-10T22:58:31.096305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:31.063891Z","title":"Emerging Properties in Self-Supervised Vision Transform- ers,","venue":null,"work_id":"f2917915-bca3-4f9e-ad40-b31f55cd9bb5","year":2021},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.150171Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:a05babee6f985f9c275cf95ce1cdf54c9c2e2e2ec0d8e17192f76da92d8f6bcb","observation_id":"955ce318-1329-4ef7-930b-1ec577e2f1b7","resolution":{"observed_at":"2026-08-10T22:58:31.079186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:30.953053Z","title":"Masked Autoencoders Are Scalable Vision Learners,","venue":null,"work_id":"e58fc0f6-5578-43ea-ba9e-ace718f9449c","year":2022},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.154310Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:529536ec644e8e4f4674333998fbbb1495b2526eec8105d9cb5f98cdd0a4452b","observation_id":"4d6cb5c3-4c14-480b-8f8d-e788c17c6357","resolution":{"observed_at":"2026-08-10T22:58:31.011954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:30.847299Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":"c3adcfe5-0279-48a7-9848-bffdf56edc98","year":2022},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.164120Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:dadfed0bbbe6860bac3cea3d2d143e58c84d7058f60d1ffe5f65b0b14df3289a","observation_id":"5cc8218c-4f72-4993-93a2-843465c9b49b","resolution":{"observed_at":"2026-08-10T22:58:30.866092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:30.835191Z","title":"Visualizing the Loss Landscape of Neural Nets,","venue":null,"work_id":"5a5caf4b-54ba-41db-b359-349382cd286c","year":2018},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.211819Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:92b426f3151383192cad58885558a2fcd64b31e7bc9d0e9e251c48cf330ecbba","observation_id":"7673bce8-5fb8-44e7-901c-8e9b469cde4b","resolution":{"observed_at":"2026-08-10T22:58:30.839889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:30.821693Z","title":"Towards Understanding the Importance of Shortcut Connections in Residual Networks,","venue":null,"work_id":"d52bf295-fba1-44c6-ac58-e55b8e3afe19","year":2019},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.279925Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:a4b56e5c3099e2aefc13869eeac729ec9237ad435aac3d9cc90de67c88cb3a62","observation_id":"8a4fb0f7-b5a9-4430-bb49-2625c911b7f6","resolution":{"observed_at":"2026-08-10T22:58:30.826136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:30.773997Z","title":"Densely Connected Convolutional Networks,","venue":null,"work_id":"60c02c8b-0c77-4e81-8fdd-06a5966a7152","year":2017},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.335783Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:0c52e5d487aa2786d06e0c1afd7a26a379bd156820daff076d7f5251e916f817","observation_id":"a1fb2017-b582-456b-8f39-acf4dacc8527","resolution":{"observed_at":"2026-08-10T22:58:30.800511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:58:30.642114Z","title":"Residual networks behave like ensembles of relatively shallow networks,","venue":null,"work_id":"32014931-1e54-48da-8584-0fb529c702a2","year":2016},"citing_paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:30.392727Z"},"links":{"citing_paper":"/paper/2501.00243"},"observation_digest":"sha256:d0b9ae79f134a7011af1ef24d734008195deb26c0437ea59459eac9ce2825cc3","observation_id":"0229c007-1735-4292-b192-1e4406e18854","resolution":{"observed_at":"2026-08-10T22:58:30.726293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.00243","last_updated":"2024-12-31T03:19:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T15:04:49.440895Z","submitted_at":"2024-12-31T03:19:38Z","title":"Cross-Layer Cache Aggregation for Token Reduction in Ultra-Fine-Grained Image Recognition"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2501.00243."}