{"as_of":"2026-08-14T12:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:448e867c060a507586e566a06a1f629a44ac7c499b2089c057ea68e1dad3bd8c","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:05:46.100364Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.00784/citation-record","integrity":"/paper/2412.00784/integrity","json":"/paper/2412.00784/citation-record.json","paper":"/paper/2412.00784"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.800988Z","title":"MixVPR: Feature mixing for visual place recognition,","venue":null,"work_id":"28e27c37-8ade-4a28-b6fd-99edfa58893b","year":2023},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.844411Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:520a1c44b61c07e140c585c3cf58b30b220a1b5f7d9ee9a8c68ea68e3b04a92b","observation_id":"7ab88d6b-aa48-473b-a0a2-8cf880369980","resolution":{"observed_at":"2026-08-12T05:05:46.804660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.849191Z","title":"Eigenplaces: Training viewpoint robust models for visual place recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.849191Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:9063e267a89fdea8c3b19eead65686efe39c3f77bb03d33374d815d05da0e5ae","observation_id":"71ce872c-0571-488a-9332-4e48f3ef5606","resolution":{"observed_at":"2026-08-12T05:05:45.849191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.783914Z","title":"Cricavpr: Cross-image correlation-aware representation learning for visual place recognition,","venue":null,"work_id":"2d18c0f7-4c19-4b64-97a7-ee6b7ac0a60e","year":2024},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.853174Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:21033f20c5d6f48d91fc557f1b91fdcd6fca3b9b1fb064714a04a2ffcceec7bc","observation_id":"4a8a8fdd-371b-4aef-8ba4-964e22224f82","resolution":{"observed_at":"2026-08-12T05:05:46.787619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.772977Z","title":"Towards seamless adaptation of pre-trained models for visual place recognition,","venue":null,"work_id":"f661918c-9099-4a7c-9ff6-b121e2219f75","year":2024},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.857262Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:ba4d29ddc9b048897280bf8f534f8895d207b32b6c4b8a69128ccb0a1edd670e","observation_id":"aa89e059-fcd2-4294-a419-013fff387f23","resolution":{"observed_at":"2026-08-12T05:05:46.776833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.861049Z","title":"BoQ: A place is worth a bag of learnable queries,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.861049Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:35cb72c1b03546490ae3080f05efed34cdc8758e0a66f162e33a3d99f3c37591","observation_id":"2658657b-e359-48bf-98a2-ff149b88fb2d","resolution":{"observed_at":"2026-08-12T05:05:45.861049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.752974Z","title":"Mapillary street-level sequences: A dataset for lifelong place JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, AUGUST 2021 13 recognition,","venue":null,"work_id":"065c0f67-3063-4659-aec8-e270cbf9decf","year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.865769Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:c6e5d4a1c2937f81c1bb376dc54fff59d86050d6e8c81b08cf8fdfe5f43b731e","observation_id":"5ec49741-504e-43e9-bb27-02536636a26d","resolution":{"observed_at":"2026-08-12T05:05:46.757131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.740670Z","title":"24/7 place recognition by view synthesis,","venue":null,"work_id":"1f4a3f79-121f-4847-9bac-6c47e006a815","year":2015},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.869780Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:16f8a1660dbe5c5433cf0340449dcf992dd82b0cb1d40f0617d24a11a0141b13","observation_id":"cc47e71c-58c0-4a4e-84a0-b9b94d6f9671","resolution":{"observed_at":"2026-08-12T05:05:46.745186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.728489Z","title":"Vpr-bench: An open-source visual place recognition eval- uation framework with quantifiable viewpoint and appearance change,","venue":null,"work_id":"eb4d4bb7-52ad-43d5-b029-90c22582e887","year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.873522Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:cc1c1d84ff75570ead92d8873d1d48069f6ac3918c94a0f014fb0a5055081cef","observation_id":"5e72b0ac-f0ae-42c4-9e18-068da4cfa7a5","resolution":{"observed_at":"2026-08-12T05:05:46.733478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.717343Z","title":"Amstertime: A visual place recognition benchmark dataset for severe domain shift,","venue":null,"work_id":"9e936779-ac9a-42cf-b067-036d50cb29d6","year":2022},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.877081Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:573a1b429439f542b203982c3356494491ba678fcd4a83a41686f8d16d1bdb80","observation_id":"413f252e-8d2d-45bf-a40a-555b12894596","resolution":{"observed_at":"2026-08-12T05:05:46.721251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.705366Z","title":"Adaptive- attentive geolocalization from few queries: A hybrid approach,","venue":null,"work_id":"833d3215-ef27-4ca1-b261-74a3e7fe1f24","year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.881172Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:c5bf9901e0b6b723fc1732ef45b3f8d63ddb6e942306eaf17635afe5e92552f2","observation_id":"da49acdc-6bd6-4f93-acf2-5722a2b50942","resolution":{"observed_at":"2026-08-12T05:05:46.709531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.694341Z","title":"Deep visual geo-localization benchmark,","venue":null,"work_id":"c22c96e0-8bd5-4e50-a350-31e3b3a809d4","year":2022},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.885038Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:8f0bed8157b8b21810b543f272799c559c3434ceaad05c26e2bd8d2d40965cb0","observation_id":"3f421e6a-7c40-461d-8482-5149f3e2cc6f","resolution":{"observed_at":"2026-08-12T05:05:46.698126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.682017Z","title":"Simultaneous localization and mapping: A survey of current trends in autonomous driving,","venue":null,"work_id":"72050cb7-1d6f-4eec-9be0-05b75e12d7f0","year":2017},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.889180Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:255ddc4b2130fee5eac2c17f9a46a546cd70c0d52f251e8da2bc551968248af2","observation_id":"ade45d46-ffd1-4690-a235-35dd200d4586","resolution":{"observed_at":"2026-08-12T05:05:46.686827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.670214Z","title":"Probabilistic visual place recognition for hierarchical localization,","venue":null,"work_id":"59ae661a-a280-49b4-995e-bc61e3313f9d","year":2020},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.892813Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:df9c8cb7a1dcfcfed6685c29742be73a8807f5910b0fe7160ffe598cba107f93","observation_id":"9cc27f8e-f3d8-4ba6-a13a-22bb6fd37391","resolution":{"observed_at":"2026-08-12T05:05:46.674111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.659298Z","title":"Global visual and semantic observations for outdoor robot localization,","venue":null,"work_id":"30fdd2de-9353-447d-b231-15757ae26f16","year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.896110Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:3a116569f4f96e594f91c25d2c6ea846f973318fc704a76ca0a82e15b8e1dd40","observation_id":"cf2a114f-03e1-4e92-9f61-516a80296093","resolution":{"observed_at":"2026-08-12T05:05:46.662962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.899654Z","title":"A low-cost and scalable framework to build large-scale localization benchmark for augmented reality,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.899654Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:e0a6644a1bfef2a968dfc41bccbe89b2cbe522fdeb6884c446b4f1f9bb26574a","observation_id":"cdda0613-708d-4858-8b2a-2576fc1f5445","resolution":{"observed_at":"2026-08-12T05:05:45.899654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.903133Z","title":"Visual place recognition: A survey,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.903133Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:73785b013d6925d304205d87574b1c73b20af1f1d7e733e0ca84d3cab40d4263","observation_id":"a4b0e35e-90a5-40b8-a3b6-b98352342f5c","resolution":{"observed_at":"2026-08-12T05:05:45.903133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.635237Z","title":"Visual place recognition: A tutorial [tutorial],","venue":null,"work_id":"abab0700-cb30-476d-8303-40c578de162a","year":2024},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.907373Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:9dd57e2c305d8f839d301676818ccc010c83fcf5245d6d27c36fe9ab6e08e75f","observation_id":"d96f50d6-a84f-402c-9839-49fbd517aa75","resolution":{"observed_at":"2026-08-12T05:05:46.639039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.910842Z","title":"Unifying deep local and global features for image search,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.910842Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:8575ab3ab8924d815932c6569310ed7bc46f1cfc4e99d6495294962666031e5e","observation_id":"4f4322c1-27de-4e58-a3fb-04a9a686d5ea","resolution":{"observed_at":"2026-08-12T05:05:45.910842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.617244Z","title":"Netvlad: Cnn architecture for weakly supervised place recognition,","venue":null,"work_id":"86aae6e3-6498-41b9-b4c0-d860d0dcde8c","year":2016},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.914271Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:b92b4d59bffa3a64a7fce645ef1f4e818d288fcdd62ded13ea453abe545c399f","observation_id":"8f25fa32-5440-460c-a69b-641dcb8ac5e4","resolution":{"observed_at":"2026-08-12T05:05:46.621115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.918007Z","title":"Fine-tuning cnn image retrieval with no human annotation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.918007Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:d1ae79ef13fca96ab00af15f01747371d916e3d2cc361dce31d46f5a6522c6fe","observation_id":"1aa7e70b-8bbd-4324-b76f-c5c61935c3f9","resolution":{"observed_at":"2026-08-12T05:05:45.918007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.921243Z","title":"Patch-netvlad: Multi-scale fusion of locally-global descriptors for place recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.921243Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:a67411d297a4b70cc03100b1cea8d0db331d480efb8c8a5695e5ceac8a66a32a","observation_id":"ce294bb3-95a2-40b0-968e-a726b3cebe58","resolution":{"observed_at":"2026-08-12T05:05:45.921243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.594394Z","title":"Hybrid cnn-transformer features for visual place recognition,","venue":null,"work_id":"5ed5f8ef-86b9-4cc4-ba04-ab1b8125104b","year":2023},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.924733Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:ccdc886c8da408df449edb7fe1285d7fd8e8dc31a036c9e5b516592b7695a29f","observation_id":"4c71d9e4-a24a-4985-bc0c-4fc8a4598aad","resolution":{"observed_at":"2026-08-12T05:05:46.598140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.582906Z","title":"Rethinking visual geo- localization for large-scale applications,","venue":null,"work_id":"164047b0-9152-4227-8b85-16dcfe415453","year":2022},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.928228Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:bacffaf626ed365f43d5ac6eba5315b035e46353ec3223bfe548cc9a24538cf5","observation_id":"aec4611a-462f-425f-ae3b-7d32fa5e403c","resolution":{"observed_at":"2026-08-12T05:05:46.586635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.931542Z","title":"Optimal transport aggregation for visual place recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.931542Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:9b4383c7be413b1d6a1c5cebc87dd138fd9be989f334529de0bf1469d4ecbcdc","observation_id":"0b4eb089-8e5d-4b50-bf8a-b3eb4e66cf8d","resolution":{"observed_at":"2026-08-12T05:05:45.931542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.566720Z","title":"Attention is all you need,","venue":null,"work_id":"28c36d38-e264-4bb6-a958-86789101655a","year":2017},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.935201Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:5f0c4794cb126739f700deba929d7ed7c3019b47618c11b1d5d3ee8a8d0713fd","observation_id":"b187f15d-76c7-498b-accc-7a1dc267c174","resolution":{"observed_at":"2026-08-12T05:05:46.570023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.556341Z","title":"Encoder-decoder with cascaded crfs for semantic segmentation,","venue":null,"work_id":"cf634258-30c7-4a2b-aa34-861b77da624a","year":1926},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.938590Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:ad46e0ab38773b813f9de3b8e2b958414848fbf6d71bb0ef488c4a6e54266ab2","observation_id":"d0481d00-9061-4859-89a6-62ac673eacf7","resolution":{"observed_at":"2026-08-12T05:05:46.560079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13280","last_updated":"2022-03-22T10:18:28Z","snapshot_observed_at":"2026-08-13T17:27:37.237385Z","submitted_at":"2021-11-26T00:35:09Z","title":"Efficient Self-Ensemble for Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.13280","snapshot_observed_at":"2026-08-12T05:05:45.941994Z","title":"Efficient self-ensemble framework for semantic segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.941994Z"},"links":{"cited_paper":"/paper/2111.13280","citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:1ec1358f5915812db4e2553c535a98f9bd4dcbf8b4ab1c82364695657effd07d","observation_id":"ea0f93b2-02fe-464b-a025-b212a26c68e6","resolution":{"observed_at":"2026-08-12T05:05:45.941994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.946109Z","title":"Per-pixel classification is not all you need for semantic segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.946109Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:3f80ec8fa6d8e37e14f665806e5f74f5462cc2342387b7e83b6b0837e554a8af","observation_id":"1b4df9d8-e7f4-4c05-980e-508561577179","resolution":{"observed_at":"2026-08-12T05:05:45.946109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.539751Z","title":"Masked-attention mask transformer for universal image segmentation,","venue":null,"work_id":"78a5f613-6b27-4f5a-9e75-27db929b81af","year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.949528Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:47a71b5b666987a6845b42fe0adfcceebd4743281520fa9e1b96dd8b11f5b707","observation_id":"da593d0b-e322-4773-a195-58525b92427f","resolution":{"observed_at":"2026-08-12T05:05:46.543505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T05:05:45.953093Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.953093Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:f2ddf4a5361b013c477836c26ff94261c3b87d38352d09935646041a684c0ea5","observation_id":"d333f8c5-b735-4b0a-ae6a-ed30d5db2ce2","resolution":{"observed_at":"2026-08-12T05:05:45.953093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-12T05:05:45.956804Z","title":"Florence: A new foundation model for computer vision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.956804Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:85a0499fe5d97f07387da4d4d7d4614ff80826f66cfe1574462d82faecd52337","observation_id":"aea54bf8-774a-4994-bcdb-b30bbfface4c","resolution":{"observed_at":"2026-08-12T05:05:45.956804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.960704Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.960704Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:1f87d60bf5b738669689b1e27e77c71588f1570cb2a3a0b3884424ab080f7c2f","observation_id":"60ad111d-936a-43ea-a7f6-2cff21138f73","resolution":{"observed_at":"2026-08-12T05:05:45.960704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00688","last_updated":"2023-11-29T04:44:30Z","snapshot_observed_at":"2026-08-13T10:43:01.787659Z","submitted_at":"2023-08-01T17:45:13Z","title":"AnyLoc: Towards Universal Visual Place Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00688","snapshot_observed_at":"2026-08-12T05:05:45.964473Z","title":"Anyloc: Towards universal visual place recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.964473Z"},"links":{"cited_paper":"/paper/2308.00688","citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:086a773aa0e9ce09fff1453a47783754433782b9c4a5b2e7068e5f8966bafe1f","observation_id":"efe702d3-2a88-48e0-9a98-849469822415","resolution":{"observed_at":"2026-08-12T05:05:45.964473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.968303Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.968303Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:014893bb540e0b67f34079d9b0017958b5eddae013470e6363c37a5621893768","observation_id":"d0e3742f-f1c7-4f43-891b-b587662c31dd","resolution":{"observed_at":"2026-08-12T05:05:45.968303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13535","last_updated":"2022-10-15T01:31:42Z","snapshot_observed_at":"2026-08-13T15:35:49.711086Z","submitted_at":"2022-05-26T17:56:15Z","title":"AdaptFormer: Adapting Vision Transformers for Scalable Visual Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13535","snapshot_observed_at":"2026-08-12T05:05:45.972701Z","title":"Adapt- former: Adapting vision transformers for scalable visual recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.972701Z"},"links":{"cited_paper":"/paper/2205.13535","citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:2788fdef5b08073036aba421e33fed15dc2c950262c42f425ff940192fd02a5d","observation_id":"4183c79e-61ab-4421-b3f7-00a1a8acbb0b","resolution":{"observed_at":"2026-08-12T05:05:45.972701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07039","last_updated":"2022-08-09T10:40:06Z","snapshot_observed_at":"2026-08-13T15:04:01.538708Z","submitted_at":"2022-07-14T16:32:28Z","title":"Convolutional Bypasses Are Better Vision Transformer Adapters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07039","snapshot_observed_at":"2026-08-12T05:05:45.976626Z","title":"Convolutional bypasses are better vision transformer adapters,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.976626Z"},"links":{"cited_paper":"/paper/2207.07039","citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:04c15f42a5f8c7fe428867f5caf59221027645c2ab6b7ac1d7db2c1620d68dc0","observation_id":"1f2d40bf-8add-4c7d-90a0-202392b1e747","resolution":{"observed_at":"2026-08-12T05:05:45.976626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.980485Z","title":"Lst: Ladder side-tuning for parameter and memory efficient transfer learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.980485Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:8b495757e9172bf69273eb8d4c25203daa99c16405536fa453874d8746a554d9","observation_id":"198dfaa5-802c-49da-ab24-1d1b9e3ce1e3","resolution":{"observed_at":"2026-08-12T05:05:45.980485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.510653Z","title":"Time-, memory-and parameter-efficient visual adaptation,","venue":null,"work_id":"a5e5aa1c-fa9c-4e4d-b541-a5b9198dad53","year":2024},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.984179Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:0204e4d16bf1d2c6062d5fd7bea59e2c432c8b6632d713cfae3948895107ad8e","observation_id":"4f72ea85-76d4-41fb-9a42-a29895f4746f","resolution":{"observed_at":"2026-08-12T05:05:46.514425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14316","last_updated":"2024-03-11T10:28:41Z","snapshot_observed_at":"2026-08-13T10:26:03.554136Z","submitted_at":"2023-08-28T05:38:43Z","title":"UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory","version":2},"cited_work":{"arxiv_id":"2308.14316","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.14316","snapshot_observed_at":"2026-08-12T05:05:46.178705Z","title":"UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory","venue":"cs.CV","work_id":"7d92a416-cb94-4f16-a5d5-f815d0c8c365","year":2023},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.987677Z"},"links":{"cited_paper":"/paper/2308.14316","citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:3549cc89886fca53ba1ca32dc8cca0f8a9b550fb378efe86887de083102bc65f","observation_id":"947f5583-5e5e-44b7-ae82-e3be60d92100","resolution":{"observed_at":"2026-08-12T05:05:46.182512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.500176Z","title":"Distinctive image features from scale-invariant keypoints,","venue":null,"work_id":"b482d8ba-da58-4065-983c-e17ac93f64d2","year":2004},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.991439Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:b6a64daa96c1482c869e255abd8ca505bf174311b81bfda15ebb8deda406029a","observation_id":"858730e9-a2c6-45b5-8290-f8a273feae5b","resolution":{"observed_at":"2026-08-12T05:05:46.503887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:45.995069Z","title":"Speeded-up robust features (surf),","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.995069Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:2ec30cb34f48404f3dd513d004512218fe197c35b46fb1b45a53bd6f9b0af2c6","observation_id":"3cc7be42-be69-49d0-9a59-521d2504dd9c","resolution":{"observed_at":"2026-08-12T05:05:45.995069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.483198Z","title":"Fab-map: Probabilistic localization and mapping in the space of appearance,","venue":null,"work_id":"fb1bde45-f5df-45b3-a932-3afdedee449b","year":2008},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:45.998779Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:b6dfbfa058c3c76e21db77c17e562fcbdcfd550bdb01b6be217cfef76d2b1655","observation_id":"6d52bf6d-85c1-405e-aa5e-f1a838d204ba","resolution":{"observed_at":"2026-08-12T05:05:46.487011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.472150Z","title":"Fast and incre- mental method for loop-closure detection using bags of visual words,","venue":null,"work_id":"d9bfce06-deb1-4d5e-8cf5-22726146f7ea","year":2008},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.002197Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:f2b907d18687d3cb91a4aa2a37b0dce69c09e63e36fa027e79178a850fa4b00a","observation_id":"ab965f3c-d256-4065-a566-9d439463692d","resolution":{"observed_at":"2026-08-12T05:05:46.475671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.461102Z","title":"Large-scale image retrieval with compressed fisher vectors,","venue":null,"work_id":"017bfcf7-e10e-4031-aaab-cf7143570e0f","year":2010},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.006213Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:c5f7e1d7cca3f8dda537bd015439c02f3462c78ec2b81661cff2b61e34fa066b","observation_id":"4e5a23c3-f252-40e5-92e0-978004fb59d6","resolution":{"observed_at":"2026-08-12T05:05:46.465053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.450261Z","title":"Aggregating local de- scriptors into a compact image representation,","venue":null,"work_id":"379925a7-4935-428b-9251-2cf7b21b6386","year":2010},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.009762Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:eb850d8a42cbbc9b23b5144ebc1db7ee47e8042f8c9a131d659d593eea8986dc","observation_id":"7261269e-0d38-4da2-8205-4301e4a49dc4","resolution":{"observed_at":"2026-08-12T05:05:46.454042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.440126Z","title":"Deep learning features at scale for visual place recognition,","venue":null,"work_id":"a6f34a3d-0e91-4e5c-9173-5b2d069df395","year":2017},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.013582Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:eae2931c540934dd60f9dd0fae4e1280774d072d64085e22e7e9baa28dd2b017","observation_id":"abbb9429-9ae2-43af-b221-c6103341e6a0","resolution":{"observed_at":"2026-08-12T05:05:46.443680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.429506Z","title":"Learned contextual feature reweighting for image geolocalization,","venue":null,"work_id":"6e74680a-f39a-41d5-a408-bf253cfd6bd7","year":2017},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.017020Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:8cfd266d50939544bf50ac5cfbe37ef29f5f4f72e271a0140d05a40ed54905e0","observation_id":"69a8cbf9-6b1e-4b26-b07d-aa656a959b2d","resolution":{"observed_at":"2026-08-12T05:05:46.433374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.020432Z","title":"End-to-end learning of deep visual representations for image retrieval,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.020432Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:92ea352543f22ae7e66c4c124447f775de07551019be507082249cfa25f5027b","observation_id":"2c86dfea-d116-4d86-869f-8dbdbd3a82dd","resolution":{"observed_at":"2026-08-12T05:05:46.020432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.412227Z","title":"Self-supervising fine-grained region similarities for large-scale image localization,","venue":null,"work_id":"c7553e08-f385-4fd2-9894-ef7024751b58","year":2020},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.023793Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:cc21b3428d4cf0cf4e9f4c9e58eff2858725880c878bc272ecad940070aefbd2","observation_id":"3368482e-e72b-4629-b0a8-3b372b1a31be","resolution":{"observed_at":"2026-08-12T05:05:46.416471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.401346Z","title":"Transvpr: Transformer-based place recognition with multi-level attention aggrega- JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, AUGUST 2021 14 tion,","venue":null,"work_id":"13129b3c-8663-4a99-92b0-0ff28675d1e3","year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.027186Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:0a4048fab4a68d75d00523124fb9ad0dc3884290ef88ca6c9349b743e427a89e","observation_id":"e8038e24-b86a-4225-b997-9bd017fd81d0","resolution":{"observed_at":"2026-08-12T05:05:46.405066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.391016Z","title":"Sta-vpr: Spatio-temporal alignment for visual place recognition,","venue":null,"work_id":"4ab9676e-db36-40d8-8f0c-8a35e99901f8","year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.030240Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:96245a289c4ac63bfdb8480e157d3e9e3dea07758b1b047cd2659f079ddfaf47","observation_id":"1d6b7c06-a811-4e0c-b476-633b2798c92f","resolution":{"observed_at":"2026-08-12T05:05:46.394825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06443","last_updated":"2021-11-09T04:10:53Z","snapshot_observed_at":"2026-08-04T20:26:17.064131Z","submitted_at":"2021-03-11T04:11:04Z","title":"Where is your place, Visual Place Recognition?","version":2},"cited_work":{"arxiv_id":"2103.06443","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.06443","snapshot_observed_at":"2026-08-12T05:05:46.162383Z","title":"Where is your place, Visual Place Recognition?","venue":"cs.RO","work_id":"e94d9c5b-0281-46a5-b080-35e2c3bf6fed","year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.033996Z"},"links":{"cited_paper":"/paper/2103.06443","citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:57318796f7e4b46d74c60150cb6335061530307407727cbf737ef03c7c67a375","observation_id":"7b98ddab-a066-4799-b5ff-d0d6403661a6","resolution":{"observed_at":"2026-08-12T05:05:46.168246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.380768Z","title":"Densernet: Weakly supervised visual localization using multi-scale feature aggrega- tion,","venue":null,"work_id":"5762d4e3-260b-48c2-9489-9fc338ccccdd","year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.037542Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:d09e1d11e05b0a8ec66577a72219fa61daddafa0e054edd2732b4b1340cd522a","observation_id":"060d5a97-1787-4e81-84b8-1e76028f80e3","resolution":{"observed_at":"2026-08-12T05:05:46.384730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.370827Z","title":"Multi- similarity loss with general pair weighting for deep metric learning,","venue":null,"work_id":"208900bd-2c15-4dd2-9520-dbad6e8d24c2","year":2019},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.040916Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:dd9828f0e48ba91f8a50971d4c7087bdbdc906c8fec566ca397dd056d93c6548","observation_id":"41c5373a-061e-4cf9-a00b-f8df3eced5b4","resolution":{"observed_at":"2026-08-12T05:05:46.374406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.360717Z","title":"Sinkhorn distances: Lightspeed computation of optimal transport,","venue":null,"work_id":"72f28014-89df-4af2-b0a3-6343281bc774","year":2013},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.044313Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:a2b4112fc7a5e205adc6439100e7ba90662912d894f7740198e942f4d68cd4fa","observation_id":"f09bb543-6f67-4b89-99f6-1ab810abcc11","resolution":{"observed_at":"2026-08-12T05:05:46.364289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.047661Z","title":"R2former: Unified retrieval and reranking transformer for place recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.047661Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:88461109f511214e297bb0ebc0dc35b988ef75f64f7ef0cd48a70cf2e07aee49","observation_id":"5bf1bfae-9856-4f6f-8637-3153039171d8","resolution":{"observed_at":"2026-08-12T05:05:46.047661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.343379Z","title":"Deep homography estimation for visual place recognition,","venue":null,"work_id":"34e79706-7d85-4cb2-8f72-b20802ea96c6","year":2024},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.050934Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:ea8ff79a5a818010e3fdbb94efa84d692c5a0959280ae7781a7d7a9ab6f051d8","observation_id":"9041a29e-4f73-47be-b52f-b3b38925b117","resolution":{"observed_at":"2026-08-12T05:05:46.347296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.332375Z","title":"Multi-task learning with multi-query transformer for dense prediction,","venue":null,"work_id":"806a3c38-6f92-4fe3-8bc2-090520671650","year":2024},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.054114Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:25253c67a1b5edede4e39c64fd94c2724f1416df79cbb67ff5125d66f365bdb1","observation_id":"61306ffe-811e-4621-a299-663603b7278b","resolution":{"observed_at":"2026-08-12T05:05:46.336077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.321396Z","title":"Few-shot learning meets transformer: Unified query-support transformers for few-shot classifica- tion,","venue":null,"work_id":"814a17a5-5451-49be-add4-26d87158aa6b","year":2023},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.057598Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:d5dce41dc97b89be9bb879c39f8aefa4d8aa07978e5d4247f5ed68c5f99fdf8b","observation_id":"405fcde9-1e0e-4c49-b97a-c7e2747044cd","resolution":{"observed_at":"2026-08-12T05:05:46.325230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.310171Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":"22d94c49-7bc1-4b11-b065-91a28e3716fb","year":2020},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.061431Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:48b883d1f67d88e02079d65da7328c3d85d5d4f16e99731791876ee44faa0716","observation_id":"a1fa6d7f-990b-4bdf-ac73-17be21225137","resolution":{"observed_at":"2026-08-12T05:05:46.314204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.298722Z","title":"Masked-attention mask transformer for universal image segmentation,","venue":null,"work_id":"0154089c-55d7-40b6-8f2f-ce51651e6e5a","year":2022},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.065278Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:45b1f85216d907a6d99ab3313213ae956a6181df584a6d2887ae516c1faa8273","observation_id":"1057a0bb-6aae-464c-ac09-ad619cc40ab1","resolution":{"observed_at":"2026-08-12T05:05:46.303084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.288092Z","title":"Image aesthetics assessment via learnable queries,","venue":null,"work_id":"4c08eeba-8ced-4e81-8c1b-b22de7a8c30e","year":2024},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.068986Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:1464f2c947d3e40afe6ae16fed3aaf62dce32c15402af76b4b671446398c759d","observation_id":"ab1dca5f-5cce-4893-9a66-da87a66a0cda","resolution":{"observed_at":"2026-08-12T05:05:46.291845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T05:05:46.072799Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.072799Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:fd1b4d546f230d20fe343b4effc44fa0b8d97a2de42796a4ead4cdb617e638ec","observation_id":"6ef91f7c-4638-4ce8-b8e0-bf66f6366695","resolution":{"observed_at":"2026-08-12T05:05:46.072799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.076674Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.076674Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:7011467c215aa21fe6089aadf9e748aedaf2b6aa6367367da5ffbe0029345b76","observation_id":"6bc21ebd-f330-4936-85b8-ae4acc266ba4","resolution":{"observed_at":"2026-08-12T05:05:46.076674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-12T05:05:46.080375Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.080375Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:9779eade910665f83584e53c4359fd88e0cb02de29596152563b2bfd3c20a018","observation_id":"d521546c-2be6-4e60-9e09-556062927361","resolution":{"observed_at":"2026-08-12T05:05:46.080375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.084405Z","title":"Gsv-cities: Toward appro- priate supervised visual place recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.084405Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:28c6c7267846930fe20c1cc9fff17806fa705ad6fcc7e1caa4b08b09125fec6b","observation_id":"3f7989c7-ec78-4c32-a2df-579fc4d55c67","resolution":{"observed_at":"2026-08-12T05:05:46.084405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.087942Z","title":"Visual place recognition with repetitive structures,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.087942Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:984c12ce490425276b9728231fb2aef86a777a0cf623979ac2f2fa82c53e5d8e","observation_id":"5767e848-5671-4616-bc90-51db38e5cb6b","resolution":{"observed_at":"2026-08-12T05:05:46.087942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06516","last_updated":"2018-08-20T15:35:29Z","snapshot_observed_at":"2026-08-07T09:30:37.975487Z","submitted_at":"2018-08-20T15:35:29Z","title":"Single-View Place Recognition under Seasonal Changes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06516","snapshot_observed_at":"2026-08-12T05:05:46.092602Z","title":"Single-view place recognition under seasonal changes,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.092602Z"},"links":{"cited_paper":"/paper/1808.06516","citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:58def6c66e40877f5db49f3cbf770b1395cb3082d6befd3224f159abfbc2df6b","observation_id":"b0c16d41-da71-478f-a2ce-a483a883641e","resolution":{"observed_at":"2026-08-12T05:05:46.092602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.257662Z","title":"Su- pervlad: Compact and robust image descriptors for visual place recogni- tion,","venue":null,"work_id":"5fea460c-15d8-422b-b4d9-fd4b076a26c2","year":2024},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.096795Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:8a16f7f606e66b323e93f358a6141789d35f5a78c1a8ba713a11f69f3002d812","observation_id":"706f7b9d-7f0f-4726-9009-7f2b0c2dc28a","resolution":{"observed_at":"2026-08-12T05:05:46.261440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:05:46.247320Z","title":"Only look once, mining distinctive landmarks from convnet for visual place recognition,","venue":null,"work_id":"b049e670-9ab7-4033-aaf8-8046cd5f1d6b","year":2017},"citing_paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T05:05:46.100364Z"},"links":{"citing_paper":"/paper/2412.00784"},"observation_digest":"sha256:c74dfbad6c5ea6bbce71b1ee340252d2acb2500a0de629f61139cad1d28d1e52","observation_id":"8d058a54-e89e-4110-9736-25308c764df0","resolution":{"observed_at":"2026-08-12T05:05:46.250967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00784","last_updated":"2025-05-25T05:53:18Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T23:18:22.374754Z","submitted_at":"2024-12-01T12:14:36Z","title":"EDTformer: An Efficient Decoder Transformer for Visual Place Recognition"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":41},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2412.00784."}