{"as_of":"2026-08-07T08:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95d8e39b96d8e7c84c29021774995fd10267b2baba938e5c4b5abe81fa682111","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:39:29.580035Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:24:49.968980Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10318","snapshot_observed_at":"2026-08-03T14:24:49.968980Z","title":"Mind the gap: Aligning vision foundation models to image feature match- ing.arXiv preprint arXiv:2507.10318, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-03T14:24:48.216973Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.968980Z"},"links":{"cited_paper":"/paper/2507.10318","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:fb02e5c779b13a38e0a75a6599584228fd95939ed8120d484b091294b69f46fb","observation_id":"5470f779-d45d-474b-a5cd-7888123a85c0","resolution":{"observed_at":"2026-08-03T14:24:49.968980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10318/citation-record","integrity":"/paper/2507.10318/integrity","json":"/paper/2507.10318/citation-record.json","paper":"/paper/2507.10318"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:37.853466Z","title":"Burst: A benchmark for unifying object recognition, segmentation and tracking in video","venue":null,"work_id":"77134c89-b4cf-4a00-a5b5-a966d69c85ca","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.108553Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:c57f2b661fc3aa0d2450c1c3cc5ee24bc236e9a03518fc63dce4ef2a2c0bd725","observation_id":"4bc141d3-7675-4a91-93f2-d87a7f3465e5","resolution":{"observed_at":"2026-08-06T17:39:37.856565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:37.842475Z","title":"Hpatches: A benchmark and evaluation of handcrafted and learned local descriptors","venue":null,"work_id":"7b891d36-6b6c-4a6b-88ba-39d9434210d7","year":2017},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.201361Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:ea363729004e205fc59d0d55fc167776efcbfc9c621803bf6b67bd6a1797e8f2","observation_id":"756c8d63-ff4b-467d-9dd6-15e914fccb81","resolution":{"observed_at":"2026-08-06T17:39:37.846283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:37.660473Z","title":null,"venue":null,"work_id":"7f8270c2-434f-4bcc-a521-faba52976e09","year":2019},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.298170Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:8e2f001d3adbd2e89719f93dd4563ea1b0df73718f26dff168491ecf47573271","observation_id":"24de8596-906f-4ce2-bd45-d38b533b1ad8","resolution":{"observed_at":"2026-08-06T17:39:37.778915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:25.377933Z","title":"Surf: Speeded up robust features","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.377933Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:35d312851113c0824f45622cc9eb297c86d760abba767419d31a75a3678f63bf","observation_id":"a2ca3393-b810-4c80-97cd-4e163f48e6bc","resolution":{"observed_at":"2026-08-06T17:39:25.377933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:37.469517Z","title":"Speeded-up robust features (surf)","venue":null,"work_id":"fe748802-31ac-4ccf-9d5b-b9714c6786e2","year":2008},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.474100Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:e0baadc1a036653c481559ed8e56b1f5d7962420f2fadb5f0f771a68571ef7b2","observation_id":"904d3fe5-893a-4e2d-bcfd-ce89a4d86e40","resolution":{"observed_at":"2026-08-06T17:39:37.567856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15961","last_updated":"2024-02-25T02:51:44Z","snapshot_observed_at":"2026-07-06T17:35:01.907906Z","submitted_at":"2024-02-25T02:51:44Z","title":"VOLoc: Visual Place Recognition by Querying Compressed Lidar Map","version":1},"cited_work":{"arxiv_id":"2402.15961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15961","snapshot_observed_at":"2026-08-06T17:39:29.908110Z","title":"VOLoc: Visual Place Recognition by Querying Compressed Lidar Map","venue":"cs.CV","work_id":"4203b644-d310-4a94-a270-995b47788e5a","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.536456Z"},"links":{"cited_paper":"/paper/2402.15961","citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:5d9be2be0f2b8ad43046c8ed29b21f8c731196631b61be4e6a0bb199dfcd1c80","observation_id":"84983732-8d76-4fd7-a9e9-a9d50bf1c739","resolution":{"observed_at":"2026-08-06T17:39:29.984495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:37.226541Z","title":"Prism: Pro- gressive dependency maximization for scale-invariant image matching","venue":null,"work_id":"50bb0b06-504a-4001-b175-e71bc1c30f65","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.625802Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:154efe603449592ade301475cf7c9433ef97dfd183c0fe04db4c5153a7c964ee","observation_id":"dc0dafdf-0a80-4042-9b63-3a67dac07e34","resolution":{"observed_at":"2026-08-06T17:39:37.392675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:37.070534Z","title":"Improving transformer-based image matching by cascaded capturing spatially informative keypoints","venue":null,"work_id":"04e2410d-0d66-453b-9c9e-dca0c183f993","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.728919Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:87946a3938c1347bce438207b10123926397489a4fbfee67434c241a27169082","observation_id":"d33e7e9d-8a53-48c3-ab78-6d6a09fea765","resolution":{"observed_at":"2026-08-06T17:39:37.154073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:36.906621Z","title":"Aspanformer: Detector-free image matching with adaptive span transformer","venue":null,"work_id":"33c6a248-3762-49bd-a3a9-0baa5eb31d17","year":2022},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.775270Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:ba16f5622fe03bd2d6fc3079490b002de3920b2855dce96757c82b11d95001c4","observation_id":"35df9448-77ba-495d-8ec8-2a9c4003d9dc","resolution":{"observed_at":"2026-08-06T17:39:36.959512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:36.667213Z","title":"Ecomatcher: Efficient clustering oriented matcher for detector-free image matching","venue":null,"work_id":"77900c6a-54c8-405f-93af-2d0c23b332ab","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.817823Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:e0522bda4e5d9c268394ffe3c9b4f6623a9a9dfc15e066f997581d9aa0e8a5fc","observation_id":"e43532a9-5957-4d6b-b6bf-ca6b5f0704d0","resolution":{"observed_at":"2026-08-06T17:39:36.754168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:36.481439Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"b16147fc-09ac-40ba-a84e-229c0eccacf0","year":2017},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.855956Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:b27bd629f32d6dd4538e772f628e7cb2b73d0822d8b5d20841220a4f21e2e20a","observation_id":"a9318b76-92f6-4235-9996-27774f6251cc","resolution":{"observed_at":"2026-08-06T17:39:36.560632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:36.281517Z","title":"Superpoint: Self-supervised interest point detection and description","venue":null,"work_id":"0d560bb7-58e7-4cf7-bb13-d12faa34f700","year":2018},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.919632Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:855e5b88b543b8e5e6d16adaaaf9e447664480c92594dfd774671d57612be6a0","observation_id":"070a27cd-51d9-4b48-b33c-3588af7b8a5c","resolution":{"observed_at":"2026-08-06T17:39:36.378666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:36.181353Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"9c1f039d-de84-4a39-a6f7-743a9f4cd40f","year":2021},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.983654Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:9f8de635cee2796a4931cd04c05326cea70115b2bd710937a1d214f9925a787e","observation_id":"1c8f08ac-794d-40a3-8521-6addefadc609","resolution":{"observed_at":"2026-08-06T17:39:36.200418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:36.041999Z","title":"Dkm: Dense kernelized feature matching for geometry estimation","venue":null,"work_id":"30df775e-fc73-40e5-abd3-bf117c883b7d","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.075536Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:3c0ee88059e5801ad90bfc9ab3d9a90e1e685a29e6b3a634b6287ca3fc803185","observation_id":"da261533-5483-4852-8b58-cb367799727c","resolution":{"observed_at":"2026-08-06T17:39:36.103809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:35.879808Z","title":"Roma: Robust dense fea- ture matching","venue":null,"work_id":"035a8813-365a-4826-8e28-9ede3ff34b3c","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.145757Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:f6920e224b1ecc4ccbe39fab6ec2c6d912cae68b99082c2049368e44359b237a","observation_id":"a12f004c-20c9-4518-b327-c2b995336d2b","resolution":{"observed_at":"2026-08-06T17:39:35.972971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:35.773254Z","title":"Top- icfm: Robust and interpretable topic-assisted feature match- ing","venue":null,"work_id":"496e140b-558c-4ec3-a1a2-fc827cc3ce25","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.220843Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:0cb23d5b9749ec7a0c09f82dc633f3dd13de62f5dde5f40a99d516678fd12918","observation_id":"bbe42dae-55cc-4b36-9f7c-861494824c09","resolution":{"observed_at":"2026-08-06T17:39:35.824253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:26.290930Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.290930Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:4a29f22fc0c58b7307f284a088c7a2de667356a047ec7a523238839156d4d11e","observation_id":"4548f61f-6638-4d1e-b0b5-b6cc1fe6d4f7","resolution":{"observed_at":"2026-08-06T17:39:26.290930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:35.579920Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"89249d34-24aa-4cc3-a08e-ce42e5c1eb21","year":2022},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.392578Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:5c3b300faf06e43c8f3166714183b675c35f7e9792c8351f23f8c280a224e2d8","observation_id":"d3577e46-a4a3-4ed2-9e62-011b3aa12c3c","resolution":{"observed_at":"2026-08-06T17:39:35.675513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:35.390869Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"dcd21134-1288-42f2-8dec-a2ccdd7235d6","year":2020},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.469629Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:6830063bdf5ac363af61ed91f2687195efd914ca24bc1669c2576e6a003aaf6d","observation_id":"e8c594b2-c443-471c-a17e-5569b80f6f26","resolution":{"observed_at":"2026-08-06T17:39:35.517902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:35.220037Z","title":"Dynamicid: Zero-shot multi-id image personalization with flexible facial editabil- ity","venue":null,"work_id":"0aca7109-04d7-4ef2-a683-d34b7f13c799","year":2025},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.535857Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:2a02c96df53811b4eb205dac931fb07813edc1e58cd072a3bc929c089a9d6ad4","observation_id":"4c876dab-15d7-424d-a0be-6d4397234437","resolution":{"observed_at":"2026-08-06T17:39:35.300228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:35.068010Z","title":"Omniglue: Generalizable feature match- ing with foundation model guidance","venue":null,"work_id":"34e1c192-9505-4ee1-9596-bf6f81671fd2","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.616999Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:dd4380cc64dcef9f7d38c3cad6eafcaaf8f1408df52a6d731e2a4291555bb4f1","observation_id":"c7ec0d92-1951-4c36-a0cf-b39b8651e222","resolution":{"observed_at":"2026-08-06T17:39:35.162338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:26.711760Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.711760Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:7c96bd76e7b183087ecebbddb53e78fe0b8120e3a44a8bfb3f25431a28b1bdb8","observation_id":"55c6ccaf-9893-4b15-a619-1b6ce19ca8e3","resolution":{"observed_at":"2026-08-06T17:39:26.711760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.916468Z","title":"Sd4match: Learning to prompt stable diffu- sion model for semantic matching","venue":null,"work_id":"7ad82336-1100-4636-8359-c98f9179b4ad","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.781562Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:1b9fd7611ee59e8cf92de0d22428053855830437b9ca0fd79b92e71aacd6864b","observation_id":"a95c3a97-891d-4892-8be2-85a0a65f7c1a","resolution":{"observed_at":"2026-08-06T17:39:35.017486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.755602Z","title":"Megadepth: Learning single- view depth prediction from internet photos","venue":null,"work_id":"a3776dbe-3717-49ab-97bf-769d630a06ee","year":2018},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.854437Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:2353b4dbb8eac51db2bd409a0b85a406683bdcec24331cb533575183e77f80cf","observation_id":"03a73a54-fa32-40d8-9682-852623082ad7","resolution":{"observed_at":"2026-08-06T17:39:34.858580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.624560Z","title":"Recrecnet: Rectangling rectified wide-angle images by thin-plate spline model and dof-based curriculum learn- ing","venue":null,"work_id":"77fa4a2d-2a15-4b6e-9e68-cc6a78159a51","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.915593Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:ef665a8e920257e6402e51e111aad2e38947fdba2b988120f21a1c30addc1a7f","observation_id":"b140ce15-c14e-40e1-8239-8b8992a360dc","resolution":{"observed_at":"2026-08-06T17:39:34.697273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.490539Z","title":"Feature pyra- mid networks for object detection","venue":null,"work_id":"dafe7395-21c9-48d8-b595-08a548a97eb0","year":2017},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.008107Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:d320f447fee37375aafcae9194e1d9fa10a1cf9efd28e35e1456605f6fbe4e11","observation_id":"cbb360a1-5166-40d3-a3a8-e95e79844a2e","resolution":{"observed_at":"2026-08-06T17:39:34.562423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.379665Z","title":"Lightglue: Local feature matching at light speed","venue":null,"work_id":"94eab665-4070-4d96-8188-54cb550f4f66","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.078922Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:2484575cd7504692aed1e7fa6efab69987f9a4f1d9a7cd68726934180bc9b08f","observation_id":"0e3b00dc-2f28-4bae-a4df-b1f79a9861ef","resolution":{"observed_at":"2026-08-06T17:39:34.421039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.247261Z","title":"Semantic- aware representation learning for homography estimation","venue":null,"work_id":"b36a5949-80e3-4eee-b98d-a0d5b3caadec","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.136387Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:2e00240ae4a471cc638b5a660f8799f7c98f96eaad4b7dd0fb7d1862a8cd8e8b","observation_id":"a27d2dc7-f8b6-49cf-8f23-14d8b8dfff31","resolution":{"observed_at":"2026-08-06T17:39:34.293249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:27.196330Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.196330Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:9169ea894bc7e76683785c45a778deee231947c06163d9df2129d93e5d4e9e87","observation_id":"67a59f89-9e45-488f-9897-935d63b327c4","resolution":{"observed_at":"2026-08-06T17:39:27.196330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.102034Z","title":"Distinctive image features from scale- invariant keypoints","venue":null,"work_id":"d4d17653-655b-4b48-b4b8-12c6ba31e8d9","year":2004},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.266560Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:10874a59e8bb39d758fd56aedd6f9982ce24a908339a24c384c7172753129550","observation_id":"94568ca6-1309-498e-97d4-f7b6be224f49","resolution":{"observed_at":"2026-08-06T17:39:34.172494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:33.955295Z","title":"Raising the ceiling: Conflict- free local feature matching with dynamic view switching","venue":null,"work_id":"c3544056-53bf-40ab-ba64-ddea12b8b2e3","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.308887Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:eb9c7f2128197e92cfc8dabb4da7f61defe57fc75a7307151f08c9c1f5183a4b","observation_id":"ff7ace8f-0a0d-4e7d-925c-e4841cde794e","resolution":{"observed_at":"2026-08-06T17:39:34.031882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19094","last_updated":"2024-01-25T07:10:41Z","snapshot_observed_at":"2026-07-06T15:35:26.335169Z","submitted_at":"2023-05-30T14:58:24Z","title":"Diffusion Model for Dense Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19094","snapshot_observed_at":"2026-08-06T17:39:27.364440Z","title":"Diffusion model for dense matching.arXiv preprint arXiv:2305.19094,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.364440Z"},"links":{"cited_paper":"/paper/2305.19094","citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:57475b329cbd51600224262bea2ab281acfe95bce3e7a3f1d0e954dca5ae9b08","observation_id":"0a3cc0d3-66f8-4460-b93e-cca54871611e","resolution":{"observed_at":"2026-08-06T17:39:27.364440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:33.811966Z","title":"Unsupervised deep image stitching: Reconstructing stitched features to images","venue":null,"work_id":"8db649a9-714b-45fc-a454-9c2cfa4378db","year":2021},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.422565Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:23ca7e7ec7821121db8d98cf927ea04a93ec7218aab586147b42049e4ce6c6fc","observation_id":"366924d7-07d4-4d99-b556-10c53e212838","resolution":{"observed_at":"2026-08-06T17:39:33.884826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T17:39:27.473301Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.473301Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:b383889f302066eb94b7c6af8437130274942a201a7a3007af2b345f8c4aeade","observation_id":"6e3d36ea-47ca-45b8-ab3f-75e0e8c32329","resolution":{"observed_at":"2026-08-06T17:39:27.473301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:33.694308Z","title":"Enhancing deformable local features by jointly learning to detect and describe keypoints","venue":null,"work_id":"7d4e5665-3592-4753-a0a6-a6dfada25ecd","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.541307Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:efcbb47ad94fcfd65a403d40e146f9809b5b9737015d78cc7b096f754cecf8d9","observation_id":"fd2881af-efa5-4df9-9ad6-c19daaa7db92","resolution":{"observed_at":"2026-08-06T17:39:33.747990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:33.518838Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"40be51bb-a933-41d2-93e7-fe2ea5c133af","year":2021},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.599471Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:796d7db23cbb6d8bbc1e94caaa8cf5034aba9c6c23abbb25cfd0280c3ca6529d","observation_id":"5a3f4967-3b91-4f78-9039-865fce183440","resolution":{"observed_at":"2026-08-06T17:39:33.625802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:33.370913Z","title":"R2d2: Reliable and repeatable detec- tor and descriptor","venue":null,"work_id":"05e14dd0-d77a-4189-80a5-4a14e1d3405d","year":2019},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.655373Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:292eeea554439b4e21309a8c29e9b086cf8e8527f5eb6bf1a3db96d9c927b825","observation_id":"70bc9d2e-73e1-4040-8a00-03d86913dc32","resolution":{"observed_at":"2026-08-06T17:39:33.457903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:33.109987Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"b024a937-1df8-42c4-9ffd-a4e64edd24ec","year":2022},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.718222Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:220cdb55bed59d0788b4f1d4d0894aaffb62a8968e7351d4b97bd4f554a75ea1","observation_id":"b21463f9-122c-4b08-bc1a-cb102224dff0","resolution":{"observed_at":"2026-08-06T17:39:33.226013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:27.778044Z","title":"Orb: An efficient alternative to sift or surf","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.778044Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:36c85945c57de8ae9f7e1032213d9ccdc1fa2de05963a2387b988d164a990a5f","observation_id":"2348e819-b850-451f-aec9-b22fe4533446","resolution":{"observed_at":"2026-08-06T17:39:27.778044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:32.838570Z","title":"Where’s waldo: Diffusion features for person- alized segmentation and retrieval","venue":null,"work_id":"6b829b15-5554-48d3-adee-014027f643c1","year":null},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.842497Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:6268ef02bd40bb716f7e6df2af7644f854a7888fe33b18de94db30b2b8fa6c5a","observation_id":"4a3840b2-ea6d-49a1-a160-26f54d845d5e","resolution":{"observed_at":"2026-08-06T17:39:32.994498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:32.544790Z","title":"From coarse to fine: Robust hierarchical localization at large scale","venue":null,"work_id":"7f1872a7-5a0a-4841-b48f-2b989e6dc487","year":2019},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.888299Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:72ea47c6d70257d116cbf3eb545fa97966252f6c7d34c146bf1d5ecab9c75504","observation_id":"d522f11c-1717-4367-bed7-b0e5294addd8","resolution":{"observed_at":"2026-08-06T17:39:32.663381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:32.363593Z","title":"Superglue: Learning feature matching with graph neural networks","venue":null,"work_id":"1beab6a7-b067-4d32-95fe-3b187c8808dd","year":2020},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.953760Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:50e970cd9a6351e2765a5826641c5633a5b9138e3158cfce093138ebbda851df","observation_id":"00c9f4eb-a961-45e8-ae7f-d6025a30d812","resolution":{"observed_at":"2026-08-06T17:39:32.425716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:32.212387Z","title":"Back to the feature: Learning robust camera localization from pixels to pose","venue":null,"work_id":"b68278cd-919a-4614-bc21-a704d90be651","year":2021},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.004243Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:27458a53ee98ed4a566d6eef7ba75afc3ddb76283352dc5faa14b61686ec0515","observation_id":"cba10385-a76f-4133-b112-10efd16b501d","resolution":{"observed_at":"2026-08-06T17:39:32.291176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:32.092815Z","title":"Benchmarking 6dof outdoor visual localization in changing conditions","venue":null,"work_id":"4568d3df-385d-4fc0-9a4d-ba9260a49edf","year":2018},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.063872Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:ba40bedf3782031cc406e2e73243a4c7c83731fe3cfaedd06411a8149d69ddfb","observation_id":"2d36e1a3-6cb1-4a23-96c6-3b81badb7119","resolution":{"observed_at":"2026-08-06T17:39:32.147368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.945361Z","title":"Structure- from-motion revisited","venue":null,"work_id":"0861c79d-7df0-4ddf-a869-8b4a3db3c1d7","year":2016},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.163328Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:617b6189a12efef978d533b7ba92b10a230a3de0c79cd3d2ccc6b300014204ec","observation_id":"fdf1efb3-359f-48af-8a60-1ab49c542121","resolution":{"observed_at":"2026-08-06T17:39:32.002162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:28.275287Z","title":"Pixelwise view selection for unstructured multi-view stereo","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.275287Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:152b20d1ff6aceb18e55c1d7f33612080b62d0d95592fc8441e773fab789dc82","observation_id":"df2232f0-de18-4a57-9fc8-bda30024a113","resolution":{"observed_at":"2026-08-06T17:39:28.275287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.768186Z","title":"Laion-5b: An open large-scale dataset for training 10 next generation image-text models","venue":null,"work_id":"225186f7-1cf9-445e-97eb-2e636f9eab95","year":2022},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.359469Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:23cb4141d1a0016cf7a5158c7762f4cc8e511db3282e59b37de78f214975be0b","observation_id":"427d96aa-3386-4763-91d0-d57e5adc142b","resolution":{"observed_at":"2026-08-06T17:39:31.869337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T17:39:28.447431Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.447431Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:d30f8119a5831f749a83484502e4c3ab91afbc656ba31d38625db14b55fdc263","observation_id":"74b1138f-c65a-4a4d-bf43-563ca1732b1a","resolution":{"observed_at":"2026-08-06T17:39:28.447431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.648967Z","title":"Loftr: Detector-free local feature matching with transformers","venue":null,"work_id":"7c925216-4647-4452-bfed-a24dfa7013f7","year":2021},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.520920Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:59a794fb0ebe3bf2112f6c63ebc030b0875a769631d84c41cd37f9b98b9e2886","observation_id":"0767a589-9a9d-4861-8944-d19cbe56baec","resolution":{"observed_at":"2026-08-06T17:39:31.711218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.516395Z","title":"Inloc: Indoor visual localization with dense matching and view synthesis","venue":null,"work_id":"5f03e7d5-8076-4c72-a0ca-858d433afd85","year":2018},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.614403Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:0e5f91463f8501d9fc60fb2c85b6d9300a696203c276b0242404e02134e008c0","observation_id":"dc90f8ae-589d-4c75-8125-0eea407c6c5b","resolution":{"observed_at":"2026-08-06T17:39:31.577976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.368442Z","title":"Emergent correspondence from image diffusion","venue":null,"work_id":"92ef1069-4db6-4d7d-a847-5153a76ea8a6","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.704467Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:a3293c5868388a2a570e1a40f6295817636b66849721b4b98d1c596af003e95a","observation_id":"f85b2797-b92d-41d2-a5ad-ddb97e4c6582","resolution":{"observed_at":"2026-08-06T17:39:31.429567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02767","last_updated":"2022-03-23T19:10:58Z","snapshot_observed_at":"2026-07-31T17:53:58.770638Z","submitted_at":"2022-01-08T05:45:32Z","title":"QuadTree Attention for Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02767","snapshot_observed_at":"2026-08-06T17:39:28.721662Z","title":"Quadtree attention for vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.721662Z"},"links":{"cited_paper":"/paper/2201.02767","citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:c80b4974d27cec96e13b68014c5dbefdfb3d6d848fdf1587633accf18fe42b1e","observation_id":"0d1b7fd6-57a2-4cb9-b2ef-591173c50acf","resolution":{"observed_at":"2026-08-06T17:39:28.721662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06700","last_updated":"2024-11-11T04:05:12Z","snapshot_observed_at":"2026-07-06T19:48:15.021550Z","submitted_at":"2024-11-11T04:05:12Z","title":"HomoMatcher: Dense Feature Matching Results with Semi-Dense Efficiency by Homography Estimation","version":1},"cited_work":{"arxiv_id":"2411.06700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.06700","snapshot_observed_at":"2026-08-06T17:39:29.710903Z","title":"HomoMatcher: Dense Feature Matching Results with Semi-Dense Efficiency by Homography Estimation","venue":"cs.CV","work_id":"dcfbfbae-d9c2-409f-9145-9063020f72ad","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.725362Z"},"links":{"cited_paper":"/paper/2411.06700","citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:3cf7a408b1763cf1047a4daebf4e5c8c80d785f67ecab826fe68d572ce79e7e3","observation_id":"61b4e027-6585-49a9-9d8a-0b944f0982ea","resolution":{"observed_at":"2026-08-06T17:39:29.795682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.235691Z","title":"Efficient loftr: Semi-dense local feature matching with sparse-like speed","venue":null,"work_id":"dc27f89a-5548-42cd-bd38-6482bbd7d671","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.728936Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:b5ef73e8abebe331cd67fe6f59aa918814efc8b9a35adc2f7318bd9b5c282cb8","observation_id":"462b7df8-e90a-4399-b2c3-2587db946e2c","resolution":{"observed_at":"2026-08-06T17:39:31.294865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.068396Z","title":"Croco: Self-supervised pre-training for 3d vision tasks by cross-view completion","venue":null,"work_id":"54d55bf7-25ba-4637-b699-8b66e5c27c31","year":2022},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.829196Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:df3f35ad223289d0811e2b2809e5417cf7724473bb3a04366de1af2e811d27dc","observation_id":"f616e622-d0f0-4e29-bd54-aa0f2a3de402","resolution":{"observed_at":"2026-08-06T17:39:31.149646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:28.904750Z","title":"Croco v2: Improved cross-view completion pre- training for stereo matching and optical flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.904750Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:db819fce47ab089c49d568fe33c1173785bde4b31aec5b5cc4d118b00bc419a3","observation_id":"09b711a5-6c11-4a40-80b8-44f20bb91b39","resolution":{"observed_at":"2026-08-06T17:39:28.904750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:30.923168Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"3523009e-e894-48fa-9382-9cf1a5ea6df9","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.981804Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:5de31f2e39a896f223967eca3263cd22dddde3e7f653f9918f9ee9e9f73f433b","observation_id":"bf421cb8-49cc-49ee-a1c1-76e69ab1ef8b","resolution":{"observed_at":"2026-08-06T17:39:30.981161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:30.791945Z","title":"Telling left from right: Identifying geometry-aware semantic corre- spondence","venue":null,"work_id":"bdf953b9-bed3-44b4-92f6-2dbc79374712","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:29.111538Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:313b2615d89fdfe70da1ebed824dd6245156df7793187fdfb5819afb7333fe5e","observation_id":"26a49359-f5fb-41d4-9b9e-09785c3cabae","resolution":{"observed_at":"2026-08-06T17:39:30.843729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:30.652040Z","title":"A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence","venue":null,"work_id":"054273dd-6639-44a3-96fc-3ce8b03ea2dc","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:29.252854Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:8eb64578829875803dbfd743ec53fe658e9e1bb5f6edfbfc7ac491078693f2fd","observation_id":"4e6a71ee-c64b-4a4b-b7ff-298e4763f738","resolution":{"observed_at":"2026-08-06T17:39:30.731910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:30.501051Z","title":"Diffglue: Diffusion-aided image feature matching","venue":null,"work_id":"167fb02c-73d7-4e4f-8105-c8e27fd7e743","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:29.347751Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:8080acaa99b1986fbdedd9711235e118a84fe9339aa6e3aed3a905ee0a1b3a26","observation_id":"e38d7acc-1889-43f7-8ca8-e58f981098e6","resolution":{"observed_at":"2026-08-06T17:39:30.584616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:30.349412Z","title":"Mesa: Matching everything by segmenting anything","venue":null,"work_id":"6cfa8c26-fd07-4b44-bb9a-1b3dec8de547","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:29.391843Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:7dd6582b5aa581016a53f2616a51ec6ea0197335af40829a1fc8e71300bbed50","observation_id":"0105457e-345d-44ef-abc4-6841eb6c8711","resolution":{"observed_at":"2026-08-06T17:39:30.407579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:29.514537Z","title":"Unleashing text-to-image diffu- sion models for visual perception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:29.514537Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:2c8f8c2e4e6c157fd0d02deb9bb0bff52d4155ae3321666d764005f1c7433ab0","observation_id":"9e353c44-b44c-4873-b468-0e978bdc14db","resolution":{"observed_at":"2026-08-06T17:39:29.514537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:30.087575Z","title":"Pmatch: Paired masked image modeling for dense geometric matching","venue":null,"work_id":"62f96358-2e49-4419-9646-a9ea77d03e4a","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:29.580035Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:06bfd309b92a3b3306543c47b552d8653a5fcc10e966c5058c20706d2b72df37","observation_id":"99ebaf2a-ed60-458b-8219-a47bfbe0fe54","resolution":{"observed_at":"2026-08-06T17:39:30.196322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:31:49.144876Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":48},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2507.10318."}