{"as_of":"2026-08-22T13:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2fbdb7cfa2874fa69141e366a1cf96ffb8a9f136c698200522d79c95f33ad71c","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:03:17.813462Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T21:25:12.373068Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:09:15.252041Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"cited_work":{"arxiv_id":"2504.16691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16691","snapshot_observed_at":"2026-07-04T00:09:15.252041Z","title":"arXiv preprint arXiv:2504.16691 , year=","venue":null,"work_id":"da41c03b-82c2-42c1-9aa6-46bd032a073b","year":null},"citing_paper":{"arxiv_id":"2606.18885","last_updated":"2026-06-17T10:00:33Z","snapshot_observed_at":"2026-08-04T13:33:45.473188Z","submitted_at":"2026-06-17T10:00:33Z","title":"LARE: Low-Attention Region Encoding for Text-Image Retrieval","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-26T21:25:12.373068Z"},"links":{"cited_paper":"/paper/2504.16691","citing_paper":"/paper/2606.18885"},"observation_digest":"sha256:6ada65ac183941616ee6d01a2c250685219ac054a9de57ecf545a1ea5c1ccf24","observation_id":"f6f8cd6b-dca3-4006-8a62-aab1d1855794","resolution":{"observed_at":"2026-07-04T00:09:15.254332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16691/citation-record","integrity":"/paper/2504.16691/integrity","json":"/paper/2504.16691/citation-record.json","paper":"/paper/2504.16691"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.899165Z","title":"Fine-grained image analysis with deep learning: A sur- vey,","venue":null,"work_id":"688a498f-fe4d-4212-938c-430b638926ad","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.499087Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:40eb112ae3fde85d1f1491c186765937a74a2c88b756d7c8a27265893c4695e6","observation_id":"4b5ebea1-ef3d-46e1-bbcc-a6a377e97285","resolution":{"observed_at":"2026-08-16T11:03:18.903928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.884378Z","title":"Deep collaborative embedding for social image understanding,","venue":null,"work_id":"93bfe94c-704d-4503-96cb-58317e2ca53c","year":2019},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.504968Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:4e865e9f0e5685d9bc1eb59cf726749de65777ec35fad292da9f65392d6d4d0c","observation_id":"02a20c97-c456-48f5-9237-adb29cdc1955","resolution":{"observed_at":"2026-08-16T11:03:18.889116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.868586Z","title":"3d object representations for fine-grained categorization,","venue":null,"work_id":"ab608991-29f4-43c4-ad6b-9e8be33a5179","year":2013},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.509762Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:7fc6f91fe41008786426061a59cf2b20773b0772ff0247e7806d9022e89a32df","observation_id":"1fe470c4-f550-4cd5-a152-781f86c5fb3f","resolution":{"observed_at":"2026-08-16T11:03:18.874080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.514902Z","title":"The caltech-ucsd birds-200-2011 dataset,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.514902Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:5ee97c4bb494a8d82c7960cfb71a591872d748911b6640fc801a05981709c679","observation_id":"53a67501-da6e-4210-b227-0efbc3007912","resolution":{"observed_at":"2026-08-16T11:03:17.514902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.843784Z","title":"Dvf: Advancing robust and accurate fine-grained image retrieval with retrieval guidelines,","venue":null,"work_id":"ed8dec58-faae-43f0-a94c-0fe41f756937","year":2024},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.519747Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:da249f7015ac6bdddd404a3c41fd0f743950a40e5453bc3885a8f887f3173e47","observation_id":"34883a59-0b45-4058-a92b-5dfaea3534b1","resolution":{"observed_at":"2026-08-16T11:03:18.848734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.827695Z","title":"Hypergraph-induced semantic tuplet loss for deep metric learning,","venue":null,"work_id":"877e3b8b-9089-4319-9409-e425f300f581","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.524783Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:089cb635de50d0ff80d127ecd07eda0e377468d268bb9f5648ac61c9d2509736","observation_id":"fd28a246-886c-4d5b-b27d-e390e791fe1c","resolution":{"observed_at":"2026-08-16T11:03:18.833067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.529951Z","title":"No fuss distance metric learning using proxies,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.529951Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:c7601193abf7895c08e6d1ac8b2dcd2ebaa1ae6e24ebfc95a0a873d952eb3c01","observation_id":"1edb6b6c-b78a-44ee-8f9b-73212b54e328","resolution":{"observed_at":"2026-08-16T11:03:17.529951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.800039Z","title":"One loss for all: Deep hashing with a single cosine similarity based learning objective,","venue":null,"work_id":"7c979695-fb3a-47ba-846e-b80bb5cc325f","year":2021},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.534575Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:d78c3a0671ccfd229ad9271bf06a68f210b1e90227012171047d942c29ae637e","observation_id":"d6c436e8-aa73-4817-9d6c-e1fcf50c8751","resolution":{"observed_at":"2026-08-16T11:03:18.806057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.783511Z","title":"Global meets local: Dual activation hashing network for large-scale fine-grained image retrieval,","venue":null,"work_id":"f8408ed8-68b4-4ad7-b96f-2c4308cedc52","year":2024},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.538890Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:9704937f35e76fdb48fbb1941765c73863d38efd7fdbf6e64b82ad8364a2a181","observation_id":"2ca8b32f-5ce8-4a14-b158-cd441f73c399","resolution":{"observed_at":"2026-08-16T11:03:18.788587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.767197Z","title":"Deep polarized network for supervised learning of accurate binary hashing codes,","venue":null,"work_id":"9d12bdfd-f751-4d82-a736-7eeaca22433d","year":2020},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.543447Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:cbc771659c8f3952d8ec60bad858703a7038f4d9da054cf4060f87f8b688618c","observation_id":"eb5a0ee3-b0a3-4a68-8953-186ebc382f44","resolution":{"observed_at":"2026-08-16T11:03:18.773084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.751295Z","title":"Central similarity quantization for efficient image and video retrieval,","venue":null,"work_id":"5a81d414-4314-4875-b537-432d274f4dd8","year":2020},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.548014Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:b78f54e18943d9e54da033aa026a64936c285c7c6b5a824ce7a42ee15898d1e0","observation_id":"2fc815ce-1cf2-4fcb-9f8f-697ed55be071","resolution":{"observed_at":"2026-08-16T11:03:18.756470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.735947Z","title":"SEMICON: A learning-to-hash solution for large-scale fine-grained image retrieval,","venue":null,"work_id":"a9fb45e5-d60b-4920-97f0-1dfd592e0de2","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.552634Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:924f2ba0b2c1f74389cf395b7d24bd2b3fa16779ff547f399bef66fd1290e302","observation_id":"b2081cd2-98ff-4781-8cad-e0e2aa56bf57","resolution":{"observed_at":"2026-08-16T11:03:18.741206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.718957Z","title":"Attribute-aware deep hashing with self-consistency for large-scale fine-grained image retrieval,","venue":null,"work_id":"423b7c3b-59ec-4d49-b34a-e57c34189d8f","year":2023},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.557018Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:c142dc8f06eb6b4036863bf82f0ee9cb19abfab66be664eb09fd5fe70b7c6a85","observation_id":"c3706d87-1fe0-4b20-8fdd-d0572696dec3","resolution":{"observed_at":"2026-08-16T11:03:18.724465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.561509Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.561509Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:e87328e6e3f503f9489453e9d4eeacd0267460ec1712b2e239ed9d79ebb8c2e0","observation_id":"369d53cc-529c-4fb0-aba6-2506ebfc714f","resolution":{"observed_at":"2026-08-16T11:03:17.561509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.691709Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":"b6356897-baef-45b6-994f-481aab6f2426","year":2021},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.565943Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:2ead019c2d68e8c8aaeed3803a1b02d2f2d306cf477ce9e55d62b6576ee63905","observation_id":"63b1af36-7b82-4a5a-8fc3-abfb9d26ca00","resolution":{"observed_at":"2026-08-16T11:03:18.696844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.676340Z","title":"Msvit: training multiscale vision transformers for image retrieval,","venue":null,"work_id":"34ed634b-2819-4412-907b-783514a5662f","year":2023},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.570411Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:c477619b493984376127de40d747ff67f2c1b6c405c8ca7b633fd4a1b3872b36","observation_id":"b6e84376-5ff2-49a7-a0ff-82f2d8091d07","resolution":{"observed_at":"2026-08-16T11:03:18.681245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.660490Z","title":"Swinfghash: Fine-grained image retrieval via transformer-based hashing network","venue":null,"work_id":"7ffa5f29-cf36-4d2b-a300-9d7383273fbd","year":2021},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.574847Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:7024fea8db6c3e86528363f057d43f79ba2c0d2b525b5e2045db25b8061dd47c","observation_id":"d72ef937-6e70-4267-a3bd-e4d367a13bd7","resolution":{"observed_at":"2026-08-16T11:03:18.665372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.645080Z","title":"No matter how: Top-down effects of verbal and semantic category knowledge on early visual perception,","venue":null,"work_id":"c93f6522-7d1a-4325-994a-58aa1f4dce3a","year":2019},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.579238Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:9b9f439d426dee5479acce9f230e9a9ef932d548dc03f5f91b33654ae4024d6b","observation_id":"6ee28df3-283c-49df-9177-cacd504540cb","resolution":{"observed_at":"2026-08-16T11:03:18.650333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.629221Z","title":"Learning attention-guided pyrami- dal features for few-shot fine-grained recognition,","venue":null,"work_id":"35c3b6aa-f0f7-4db4-9d8f-df9c2d6f2373","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.583653Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:4a818d95b35d35aeebc57cae77783b7f19e846374dee62a855ab959063401da4","observation_id":"1b2786f8-a578-42b3-a8db-faf1bc961751","resolution":{"observed_at":"2026-08-16T11:03:18.634120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.614760Z","title":"Divide-and-conquer: Confluent triple-flow network for rgb-t salient object detection,","venue":null,"work_id":"76733a89-49ec-4eda-a1cb-03624bfa4182","year":1958},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.587841Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:327058253f1edd633d1fe0af66eb04835a8da2f590212cba78f269d83da12cec","observation_id":"75cab98d-bdb3-47d7-aad5-1d76f4bb6fd7","resolution":{"observed_at":"2026-08-16T11:03:18.619444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.599745Z","title":"Adaptive token sampling for efficient vision transformers,","venue":null,"work_id":"27cea1d6-6b90-42b4-91e4-b2776081e0ef","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.592132Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:936fe80318755c666602ef82c2897c4c5c16c7cc638a0a2c3b90634d8464bdab","observation_id":"265ffa9c-8428-4501-a502-a806ee4105aa","resolution":{"observed_at":"2026-08-16T11:03:18.604527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.584961Z","title":"Token merging: Your vit but faster,","venue":null,"work_id":"7357f877-0e91-4ad6-a930-1e069c68938e","year":2023},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.596542Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:a3a17cfcc25004749d805967159c81c99fbb0d036a2f51eae8774f8d8b6d4698","observation_id":"df904c95-3281-48aa-a86b-fc70a151223e","resolution":{"observed_at":"2026-08-16T11:03:18.589882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.570069Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification,","venue":null,"work_id":"4b581110-5d64-48ff-bc8c-6b43c497cd57","year":2021},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.600953Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:0a23e95b13dea07bf36ef708daf8ecaba6216340696a71d9f56da85bfc8bf965","observation_id":"67944a2e-9b9f-499c-a7d0-87ab9f480104","resolution":{"observed_at":"2026-08-16T11:03:18.574935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.554754Z","title":"Bilinear CNN models for fine- grained visual recognition,","venue":null,"work_id":"83a7880b-d68b-46f7-a1cc-ec36c72a33f6","year":2015},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.605204Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:d6c9d319525dd7273ff67d1af6af159a0bf9a05bdf9e7f666820e88043800550","observation_id":"cdfa8a4f-254a-42f8-b136-6815ae8fcd5f","resolution":{"observed_at":"2026-08-16T11:03:18.559712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.540057Z","title":"Compact bilinear pooling,","venue":null,"work_id":"bf4aff35-ec25-497f-904d-620528530c24","year":2016},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.609456Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:32db9de6fc3223d59376ff65ef61c8f75867c33fe81c3d849f3099a198c5bbf6","observation_id":"b1774ac6-019c-4c4a-8fb7-0271b2e7b65e","resolution":{"observed_at":"2026-08-16T11:03:18.544642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.525201Z","title":"Hierarchical bilinear pooling for fine-grained visual recognition,","venue":null,"work_id":"a58d05b7-0e20-4a14-a0cb-af6589523516","year":2018},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.613514Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:b47d0e7729f0b4e1735cda99a399b5c2d5653c425acffc41839ad93bafaf9254","observation_id":"e6cb0d38-55ca-4c3a-a450-269f698d1305","resolution":{"observed_at":"2026-08-16T11:03:18.530300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.509931Z","title":"Deep LAC: deep localization, alignment and classification for fine-grained recognition,","venue":null,"work_id":"e1d0d12f-5980-464f-a9c7-8275cf17f24d","year":2015},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.617653Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:84279aec373cad5bc8c2ae1521f2552370b465757695677f15004fa3ea960866","observation_id":"ce92b665-8ccb-4920-80e6-834496495072","resolution":{"observed_at":"2026-08-16T11:03:18.514611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.494755Z","title":"Boosting few-shot fine-grained recognition with background suppression and foreground alignment,","venue":null,"work_id":"82af3bcc-8b38-4993-b895-cda979895443","year":2023},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.622172Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:61da42a64067ad34e821767638b2c19f955acba26e74ac87a57425b3cb4ee0c6","observation_id":"c1005a57-3f60-4670-a532-c1f87feadd97","resolution":{"observed_at":"2026-08-16T11:03:18.499742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.479379Z","title":"Fine-grained visual classification via internal ensemble learning transformer,","venue":null,"work_id":"ea772ca0-4cf2-4ec6-a0e4-1ad7bed20a55","year":2023},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.626473Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:960d2f37d478b62641a86883f04f3bafa303b038e17f65d3540b323a1f483c15","observation_id":"9c0a8ca3-a0ed-4b5b-852a-dda6b239a96d","resolution":{"observed_at":"2026-08-16T11:03:18.484494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.463990Z","title":"Delving into multi- modal prompting for fine-grained visual classification,","venue":null,"work_id":"34c554d6-0f15-4652-a016-8cc208e795b4","year":2024},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.630823Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:7cc086df096ed182bc50cfafb411edefed8265210c57d95f840c905247aaf885","observation_id":"5faae47c-c455-4a2b-b7a7-3dafb3246b02","resolution":{"observed_at":"2026-08-16T11:03:18.468989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.448200Z","title":"Part-based r-cnns for fine-grained category detection,","venue":null,"work_id":"1c411cdb-c224-4ae3-a1d3-0ae7db15b429","year":2014},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.635230Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:1e241cc9886dc5d98664056dd9369f162f69608bdc76c0de45b3e144a6ecd40b","observation_id":"5ac241c0-816d-4e88-a1e9-0fc75b3acaaa","resolution":{"observed_at":"2026-08-16T11:03:18.453089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.431711Z","title":"P-CNN: part-based con- volutional neural networks for fine-grained visual categorization,","venue":null,"work_id":"72e724bc-47ae-4d23-a433-2b79046b6648","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.639547Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:33c2741f7d4bef14999868ecdb47e310bb31e7a68d948da3b71ed2acf5784d17","observation_id":"a39a3655-9a46-4f89-976a-2f193f4ecb0a","resolution":{"observed_at":"2026-08-16T11:03:18.437201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.415013Z","title":"Cross-part learning for fine-grained image classification,","venue":null,"work_id":"e287b991-7def-4419-a267-0d8188b4a71c","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.643823Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:6d96a56ea9a3c04587cf25c49681fe8971857c900964e9bc7612e3b5ad02eafe","observation_id":"ae812f74-8d80-45f8-9f51-d9f4c1c7a4ab","resolution":{"observed_at":"2026-08-16T11:03:18.419892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12705","last_updated":"2024-08-06T13:06:26Z","snapshot_observed_at":"2026-08-20T15:13:35.372038Z","submitted_at":"2024-07-17T16:26:30Z","title":"IMAGDressing-v1: Customizable Virtual Dressing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12705","snapshot_observed_at":"2026-08-16T11:03:17.648534Z","title":"Imagdressing-v1: Customizable virtual dressing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.648534Z"},"links":{"cited_paper":"/paper/2407.12705","citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:6d7489d0e3355475cc50a58e8a037c7940108f1598d34178fb790d74238d08d3","observation_id":"c0610ad3-b036-4677-a367-b2032b0a0975","resolution":{"observed_at":"2026-08-16T11:03:17.648534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.399070Z","title":"Hyperbolic vision transformers: Combining improvements in metric learning,","venue":null,"work_id":"04cf9a07-2d30-4f39-8e9a-5fc474f6fc11","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.653183Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:f7dce974dae21da8e25158a14dcb4a74c42eabf58fb3ce466b8aa2d96bc174cf","observation_id":"b50219d4-8f48-4ade-9df3-5a41cc01112d","resolution":{"observed_at":"2026-08-16T11:03:18.404003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.383463Z","title":"Proxynca++: Revisiting and revitalizing proxy neighborhood component analysis,","venue":null,"work_id":"ee23fa76-1940-442a-bd70-387e4b2382c0","year":2020},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.657597Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:d690fc39f70a64480a8b07e56bc092115dcaaaa95a84a00e793a97363237267f","observation_id":"4c62c839-1fdc-4aea-8523-f705db03b9f9","resolution":{"observed_at":"2026-08-16T11:03:18.388457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.367158Z","title":"Boosting vision transformers for image retrieval,","venue":null,"work_id":"203a5078-d61d-42f0-999c-fd0691e9b902","year":2023},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.661647Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:94f3cc04dc6fc8e728a0a7a3193ad562e43deda19444a8ac35104eeebc63988c","observation_id":"2c966750-c951-4968-bb2e-ec1e05d8f6ca","resolution":{"observed_at":"2026-08-16T11:03:18.372205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.350769Z","title":"Re-id- leak: Membership inference attacks against person re-identification,","venue":null,"work_id":"b6a9c2e5-702f-46cc-9833-2c21dc72d726","year":2024},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.665774Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:ddc44b23a7430457a1f818b2feb8b1fa244d0fc7ce2855cb0f8fcb022f52fedd","observation_id":"b35f0144-d1fa-4510-b0ff-f725fc04c2b6","resolution":{"observed_at":"2026-08-16T11:03:18.356136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.670126Z","title":"Git: Graph interactive transformer for vehicle re-identification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.670126Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:736b7e159076ac7446938955d2b9ffc029c7fffed94697d50a1cb9c9d60b3ac4","observation_id":"1c5f2111-fed1-4cc6-b268-66c06a7ed918","resolution":{"observed_at":"2026-08-16T11:03:17.670126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.323963Z","title":"Deep saliency hashing for fine-grained retrieval,","venue":null,"work_id":"6b4918fe-68cb-4160-a0ec-0fc353e30113","year":2020},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.674687Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:a0208edec737204f599f35ddc360924e2dc32d5f2b1dafe8e70a9c8c7cd5378e","observation_id":"b6e5f4ef-b8ca-45ca-bef2-8108fe4c1dd5","resolution":{"observed_at":"2026-08-16T11:03:18.329242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.306874Z","title":"A 2-net: Learning attribute-aware hash codes for large-scale fine-grained image retrieval,","venue":null,"work_id":"7cd86f0e-a4c2-4d79-9b3c-42b419415e12","year":2021},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.678967Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:a479449a64aaad3bbb534a0cb19ff55b023d2f8534f68654b574edcae7aff997","observation_id":"188d6ce3-ce35-47dc-95d5-a35378ccd6c9","resolution":{"observed_at":"2026-08-16T11:03:18.311897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.290828Z","title":"Fine-grained hashing with double filtering,","venue":null,"work_id":"f4431d64-59da-48f6-bde6-8d0b9666f80d","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.683570Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:8371459d73c8905677f65b59a43af9128197c421a65333fedaeacf52c77a66b0","observation_id":"d91f9606-79f0-4a24-b174-0759544128b2","resolution":{"observed_at":"2026-08-16T11:03:18.296201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.274042Z","title":"Deep progressive asymmetric quantization based on causal intervention for fine-grained image retrieval,","venue":null,"work_id":"20e8aed0-7e09-449c-acee-5501e82d3a79","year":2024},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.687834Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:feb35efb3c80e175595c196f83d918a21dc98c668d45362673a78a1236b9656c","observation_id":"276a0e0d-42d0-4f59-8295-1f83af87176e","resolution":{"observed_at":"2026-08-16T11:03:18.279877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.258581Z","title":"Deep neighbor- hood structure-preserving hashing for large-scale image retrieval,","venue":null,"work_id":"33676a6f-0b45-4205-8c22-b01ecb5fb034","year":2024},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.692546Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:1218abd8e64c89446d6e6e3f2a5a3acb198c1f41786f003cb675277ac83b0cfd","observation_id":"cdbd307f-2901-424b-bca6-24f52ecf0300","resolution":{"observed_at":"2026-08-16T11:03:18.263340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.243051Z","title":"Supervised deep hashing for scalable face image retrieval,","venue":null,"work_id":"dffd5d66-d9b4-4327-ae01-0bc23adc165e","year":2018},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.696936Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:2d56160796074e2d9e6dc7c2d2d6002a8aac053e03accc88467b4a597ea34592","observation_id":"d37243b7-9a36-44a7-828f-d09d2981aeba","resolution":{"observed_at":"2026-08-16T11:03:18.248036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.701437Z","title":"Weakly-supervised semantic guided hashing for social image retrieval,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.701437Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:6b3ab0098baf484804deba7baeec8ee8fc080a2435d483a7cded56c979e2cdad","observation_id":"c1a59fcf-71c2-4613-9006-05fd2d4b68d7","resolution":{"observed_at":"2026-08-16T11:03:17.701437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.217164Z","title":"Fast locality-sensitive hashing,","venue":null,"work_id":"3263a51a-9dda-415e-997b-33fb50ea06be","year":2011},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.705507Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:aa6dcf3643f5619b656524ca90c96ebc503c978b876b8850103a7f97fee9d1ed","observation_id":"6eda0f35-bc75-4c49-b6e1-7db57381340b","resolution":{"observed_at":"2026-08-16T11:03:18.222052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.201645Z","title":"HHF: hashing-guided hinge function for deep hashing retrieval,","venue":null,"work_id":"e3e0d614-7f1a-48bc-aa50-f2f4b1b61308","year":2023},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.709841Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:7255fc1e2c06c909aca5768a0ddc4946dda772baef6425591b7a49ca6a3c87e5","observation_id":"99596cb4-eecd-4eae-a4d2-c4ae2384cdd8","resolution":{"observed_at":"2026-08-16T11:03:18.206682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.714372Z","title":"Iterative quantiza- tion: A procrustean approach to learning binary codes for large-scale image retrieval,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.714372Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:37fcd98a0e085f2884ef24ace1e34df724a4e06d6723b420a1edf2859043bf19","observation_id":"2fcd874a-9ba9-486f-acf0-a495820ae834","resolution":{"observed_at":"2026-08-16T11:03:17.714372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.175232Z","title":"Asymmetric deep supervised hashing,","venue":null,"work_id":"16bd026b-7f53-440c-a069-4a50c0017120","year":2018},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.718629Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:ce60d010eb38e1197ec42a436640542e2be59afaa709789448945fc6f2abbb16","observation_id":"6dd415e7-adf2-401c-9d95-a253bd6a864f","resolution":{"observed_at":"2026-08-16T11:03:18.179962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.158443Z","title":"Self-paced relational contrastive hash- ing for large-scale image retrieval,","venue":null,"work_id":"25068e4d-22a6-4322-9a56-aed0b1ef2313","year":2024},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.722761Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:f9fb542d82f24a98d2eb43f0a8f592e43a1ff7fcaa7a3252d6815b9ee87e3d82","observation_id":"b7c358e6-e337-4038-9b71-31612d940813","resolution":{"observed_at":"2026-08-16T11:03:18.163923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.141298Z","title":"Alleviating over-fitting in hashing-based fine-grained image retrieval: From causal feature learning to binary-injected hash learning,","venue":null,"work_id":"a815a1e6-8de5-421e-b355-d49c93b25928","year":2024},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.727487Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:bfcabef43d1c803af42fcbe1bf4ee459f89e922d759ec669cbb357db7e6dbf5f","observation_id":"49da15d9-2044-455f-9dd3-67b87ff7c2a2","resolution":{"observed_at":"2026-08-16T11:03:18.146521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.124777Z","title":"Densifying one permutation hashing via rota- tion for fast near neighbor search,","venue":null,"work_id":"b93f17fb-0c94-4c96-8df9-6ae4f06cbc2b","year":2014},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.731769Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:36b1be17749ea248ae3d6222b8456dd0255149198b728a14fd529cfc88b07e3e","observation_id":"044f143c-a4c9-4e32-82c8-28053f719763","resolution":{"observed_at":"2026-08-16T11:03:18.129871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04869","last_updated":"2023-03-29T21:00:43Z","snapshot_observed_at":"2026-08-19T11:56:53.491383Z","submitted_at":"2021-10-10T18:04:59Z","title":"Global Vision Transformer Pruning with Hessian-Aware Saliency","version":2},"cited_work":{"arxiv_id":"2110.04869","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.04869","snapshot_observed_at":"2026-08-16T11:03:17.888913Z","title":"Global Vision Transformer Pruning with Hessian-Aware Saliency","venue":"cs.CV","work_id":"c10100d5-4f1a-4508-83b7-c6d255cda074","year":2021},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.736169Z"},"links":{"cited_paper":"/paper/2110.04869","citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:d04ff5301ead5edd7ec3383520dba0b63190c5253a64f767219e8fbe6b84224d","observation_id":"e692db0e-9840-4af8-992b-6d7f46e1f82c","resolution":{"observed_at":"2026-08-16T11:03:17.894072Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.109126Z","title":"Chasing sparsity in vision transformers: An end-to-end exploration,","venue":null,"work_id":"96130ef7-968d-4579-89dd-f0de2f2292bb","year":2021},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.740928Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:1d9e986f41143a0e2b9be29b139744ba9132aaa4938efb4926b60599c6a14c05","observation_id":"627fc65f-608e-4ea8-9fbb-0a6b1a313a1e","resolution":{"observed_at":"2026-08-16T11:03:18.114277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12620","last_updated":"2021-10-26T22:41:23Z","snapshot_observed_at":"2026-08-19T11:56:54.239856Z","submitted_at":"2021-06-23T18:29:23Z","title":"IA-RED$^2$: Interpretability-Aware Redundancy Reduction for Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.12620","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.12620","snapshot_observed_at":"2026-08-16T11:03:17.865423Z","title":"IA-RED$^2$: Interpretability-Aware Redundancy Reduction for Vision Transformers","venue":"cs.CV","work_id":"d536d332-4e5b-4dbb-98be-7c50403eb96e","year":2021},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.745273Z"},"links":{"cited_paper":"/paper/2106.12620","citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:a3528e4bf014e3f62d067c99aa85aab2497b0ae7a0806f8257dfafefb7b95db3","observation_id":"3521cebe-b345-45fa-8c0e-429c309c2c80","resolution":{"observed_at":"2026-08-16T11:03:17.872224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.078778Z","title":"Evo-vit: Slow-fast token evolution for dynamic vision transformer,","venue":null,"work_id":"5fb1aa87-03f3-45f9-93e2-cc92dfaa6c83","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.754452Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:362a705b0eebe3327f786a44a99827acdbacc87ee9acba81a0b50f5e8475467d","observation_id":"f4ff2d2c-f556-4f96-ad0d-9f2971db04ea","resolution":{"observed_at":"2026-08-16T11:03:18.083766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.094056Z","title":"Evit: Expediting vision transformers via token reorganizations,","venue":null,"work_id":"c63c23cd-99a7-4e07-916e-92953cdec519","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.759265Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:786b1fd90595fcd0f948445a79c3ad0a190ca3c251e080eb0f5801c48daeef43","observation_id":"19ecc4ce-dd66-4f44-88c2-455f69ee051e","resolution":{"observed_at":"2026-08-16T11:03:18.098944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.763945Z","title":"Squeeze-and-excitation networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.763945Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:a66d821b4330fbe412292b58f9ecd9f4f6b9f9de282cd86b78d74595cdfbb03d","observation_id":"205bcc39-0d51-4dd7-bed0-4fa349602e92","resolution":{"observed_at":"2026-08-16T11:03:17.763945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.052698Z","title":"Vitkd: Feature- based knowledge distillation for vision transformers,","venue":null,"work_id":"81f322da-5cc9-4f26-a814-a874c3b5a57b","year":2024},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.768579Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:f6bb3bff69e6a971a752f2c1961c1ff69e13f62f0d575085ae194e3ff291d99f","observation_id":"b6c10038-9f98-4556-be0b-3386ec5d6123","resolution":{"observed_at":"2026-08-16T11:03:18.057553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.037724Z","title":"Transformer- based distillation hash learning for image retrieval,","venue":null,"work_id":"e6cdb814-2966-4c55-b381-350cd44a3253","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.773007Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:5186dec2070873fb515d70db76c8e57c3468ade7bee19b192e1e5b0829febbc3","observation_id":"ad973ac8-047e-47c8-b322-f49e27723cd1","resolution":{"observed_at":"2026-08-16T11:03:18.042547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-16T11:03:17.777348Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.777348Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:db4d5dd8d7646dd21a5fd2a09d465d615b32700a907316b9f545b3994e47d70d","observation_id":"10168756-9cd5-41f1-b676-db3c21831ae4","resolution":{"observed_at":"2026-08-16T11:03:17.777348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.021665Z","title":"Deep listwise triplet hashing for fine-grained image retrieval,","venue":null,"work_id":"bc7275ab-a74a-49e4-b841-cc6e045069e3","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.782377Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:d335e878939e32d9028570c6abf3287b37b0019106c4afeb0beab206e0b4cade","observation_id":"b6dba591-9b5e-4267-94e1-d0ea9e301ded","resolution":{"observed_at":"2026-08-16T11:03:18.027133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:18.005087Z","title":"Sub-region localized hashing for fine-grained image retrieval,","venue":null,"work_id":"bb807e8b-d8d4-4511-8682-55e42a5ffb8c","year":2022},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.786769Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:b865f9c3724a4cebb6536c351298cb582a5fb2879427af9793b4afa7a96575a4","observation_id":"81be6f91-7100-47ea-99bc-d2d3760bfba5","resolution":{"observed_at":"2026-08-16T11:03:18.009858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.990107Z","title":"Exchnet: A unified hashing network for large-scale fine-grained image retrieval,","venue":null,"work_id":"a6a9bbaf-9428-4a3e-862b-e46c071cb168","year":2020},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.791145Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:a2bfd6c7edc47abd59fdb03af49d27cc5c509d24d55be06f49e41c42d68713d0","observation_id":"2cf593b6-83e8-4f30-9718-4c61de079c15","resolution":{"observed_at":"2026-08-16T11:03:17.994907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.975367Z","title":"Building a bird recognition app and large scale dataset with citizen scientists: The fine print in fine-grained dataset collection,","venue":null,"work_id":"d3db4d84-bfd7-4e9a-9776-48f3f0da4e4f","year":2015},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.795656Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:b441403d2907915af3333f2579681f1c1200d2e5e9ca6fdb0d77313a44d79393","observation_id":"75c5c493-baf9-49ea-9766-4243a81ad2dd","resolution":{"observed_at":"2026-08-16T11:03:17.980175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.960019Z","title":"Vegfru: A domain-specific dataset for fine-grained visual categorization,","venue":null,"work_id":"a70195f8-3cb1-45f0-b45d-eec83e030d13","year":2017},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.800536Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:1cd948b5e8b9526add4359366fd07c38b6d122918bb0ba412718f4b578c76b20","observation_id":"3483897b-bd57-4d25-9367-284840475669","resolution":{"observed_at":"2026-08-16T11:03:17.964810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.944597Z","title":"Food-101 - mining discriminative components with random forests,","venue":null,"work_id":"828001f3-04ab-4fe4-bac4-8618eabfd16e","year":2014},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.804764Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:bc1bdbfbef8f48f462fba89ced473c4c1f23956d0235625da782cab729843064","observation_id":"4d857f82-f2f4-4d23-9d6d-ff1e7c252cc8","resolution":{"observed_at":"2026-08-16T11:03:17.949248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.809074Z","title":"The inaturalist species classifi- cation and detection dataset,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.809074Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:600ab0ecbb7fe0983b8309dac9ce77f08db78c9c4aa84214da3c110a3eea3428","observation_id":"49912339-a330-4bc1-8919-2e7e2669835a","resolution":{"observed_at":"2026-08-16T11:03:17.809074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:03:17.919645Z","title":"Char- acteristics matching based hash codes generation for efficient fine- grained image retrieval,","venue":null,"work_id":"28a3073a-2a7e-45db-a4b0-792558406594","year":2024},"citing_paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T11:03:17.813462Z"},"links":{"citing_paper":"/paper/2504.16691"},"observation_digest":"sha256:325126d373c3b3be93fee3478ad1176f5c9e473d5096f7d49e85ddf5eaa74ba5","observation_id":"44623948-e2d6-4cc0-bb63-b8bd8e86aa38","resolution":{"observed_at":"2026-08-16T11:03:17.924653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.16691","last_updated":"2025-04-23T13:23:56Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-20T15:14:07.865255Z","submitted_at":"2025-04-23T13:23:56Z","title":"Rethinking Vision Transformer for Large-Scale Fine-Grained Image Retrieval"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":58},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2504.16691."}