{"as_of":"2026-08-05T13:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d4efe33ea9ee0e67d47d87b9555feb08b18429f276aa6db0243a6ace03e6e77","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:39:17.229872Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.10721/citation-record","integrity":"/paper/2604.10721/integrity","json":"/paper/2604.10721/citation-record.json","paper":"/paper/2604.10721"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":"2412.08905","doi":"10.48550/arxiv.2412.08905","metadata_source":"pith","pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-4 Technical Report","venue":"cs.CL","work_id":"b6274271-7af9-4ee8-993b-ba1ba4205ba8","year":2024},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:492479d0f1fe8bb7684dd5bd6e9639cedede07eb2f1805798b951d8c7392cd05","observation_id":"a9bdc644-6d89-4ddc-b444-4432c8f91b75","resolution":{"observed_at":"2026-05-11T10:06:03.038475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:11.323957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:11.323957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:6417946d6473de15416605c7a3d9fec8efddc661865bab366e6c627c3a18209f","observation_id":"58c4810e-ec5d-4931-bbd7-41a215e98f90","resolution":{"observed_at":"2026-05-11T10:06:03.164288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-and-language navigation: In- terpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":"769b623e-02bf-4f86-9a35-75ddd190a566","year":null},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:96c31b2c432b054749fdd5421b0f5ce9cb2c262e7357d66176d612c180a58364","observation_id":"0926454b-3ddc-4ab2-8954-5f1cd00f3a4a","resolution":{"observed_at":"2026-05-17T19:30:10.882877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view meets diffusion: Aerial im- age synthesis with geometry and text guidance","venue":null,"work_id":"4fe34c4f-a785-4acb-99e3-cf5ad334b264","year":2025},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:070a8b463ff7dd6289eadc8bd27c8c7a11b50ed100bb443b66da1e0cffc12b37","observation_id":"8bf7281f-3a4d-44d2-8a6f-a811aba68607","resolution":{"observed_at":"2026-05-17T19:30:10.876789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05961","last_updated":"2024-08-21T22:46:05Z","snapshot_observed_at":"2026-07-06T17:57:31.912970Z","submitted_at":"2024-04-09T02:51:05Z","title":"LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders","version":2},"cited_work":{"arxiv_id":"2404.05961","doi":"10.48550/arxiv.2404.05961","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05961","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM2Vec: Large language models are secretly powerful text encoders","venue":"arXiv (Cornell University)","work_id":"156e1320-54cd-416f-af15-d9da54374957","year":2024},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"cited_paper":"/paper/2404.05961","citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:5fcf881ebd0ec26ec211ea9d0e24a7e69c73ad0e6a728325b5ac8c1b0fc45f2d","observation_id":"1d95bd3d-6d53-462d-ac25-43bdb82aacc6","resolution":{"observed_at":"2026-05-11T10:06:03.148741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ground-to-aerial image geo-localization with a hard exemplar reweighting triplet loss","venue":null,"work_id":"6cd6ec77-3265-46bf-932b-c80797fb4140","year":2019},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:2e390be3bc0f1b598ac9e1ffb8329dda0a7829037195f1c2f7ececad7a111202","observation_id":"db9cee2a-cf70-432a-8c1d-986b9cbc12b4","resolution":{"observed_at":"2026-05-17T19:30:10.900241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"55f4866a-7f15-47ac-8721-71ca57e39b0d","year":2020},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:66c44f7f27dc17bc2de570fee4e62855f5f0927303885b29f41f60a34075bc4c","observation_id":"2e6d8a88-e612-4a8c-b338-11d59d9bf0c4","resolution":{"observed_at":"2026-05-17T19:30:10.871007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"ad4d48ab-6df2-423b-a310-5625fb49f5c8","year":2020},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:2793919649b143ed595e9ce2aa3f9aa7d6af1439a2f802182dd4f6351ab3111c","observation_id":"96e4ba77-2fb2-42e7-a42d-b274cd70c517","resolution":{"observed_at":"2026-05-17T19:30:10.873906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.094005Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"2407a8b7-39af-40a3-9023-1dc5267526d5","year":null},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:f63e8239dd38962af1d69f06f2c6a3e7e335964bd3a8ad0ae99ded3244e7d32f","observation_id":"79fffef6-e69f-4b3b-bcff-d9d8a9fb97d6","resolution":{"observed_at":"2026-05-17T19:30:10.879541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards natural language-guided drones: Geotext-1652 benchmark with spatial relation matching","venue":null,"work_id":"e552ece0-edcb-47db-b709-b6a1604a3aab","year":2024},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:ac364be4fbee4f84fd67956bf25b4eb5cb5350a793b7a68ad8fbae67f4c4faab","observation_id":"0176d87a-d831-4b34-8df7-7bed01c48fb7","resolution":{"observed_at":"2026-05-17T19:30:10.892489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam- ple4geo: Hard negative sampling for cross-view geo- localisation","venue":null,"work_id":"4b6f0b59-e576-42fb-87ed-7ffc2ee6d94a","year":2023},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:7cd1f2815d464ce1a98742da905adb02f0ea70d75d2ae0ad8f504c76b3b651e7","observation_id":"72bca8c7-2915-4eac-99de-947727dee97b","resolution":{"observed_at":"2026-05-17T19:30:10.886177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An empirical study of training end-to-end vision-and-language transformers","venue":null,"work_id":"1efc3d71-0ae2-45da-8679-7bd4dc42205c","year":2022},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:221c7c6ec6b3d99f2d9bfbe5e071ff03e1b64e5a399b1f69f1a6c9f57c63be58","observation_id":"aebc0807-66f0-43f9-a787-bc8470014046","resolution":{"observed_at":"2026-05-17T19:30:10.858426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08821","last_updated":"2022-05-18T12:29:49Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:27:08Z","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","version":4},"cited_work":{"arxiv_id":"2104.08821","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.08821","snapshot_observed_at":"2026-07-04T20:00:08.897138Z","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","venue":"cs.CL","work_id":"e9fab1e4-f443-4963-9f2a-83f772482c00","year":2021},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"cited_paper":"/paper/2104.08821","citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:64100d966fa4e68427808e93a27f6c18c9d7f2d6e56049c1c869c3b6868efddf","observation_id":"a1f6b41e-f0bc-4413-9e21-d19700714837","resolution":{"observed_at":"2026-05-15T07:48:23.738089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Skysense: A multi-modal remote sens- ing foundation model towards universal interpretation for earth observation imagery","venue":null,"work_id":"af4da362-89cc-40a2-afac-e0f3ed344868","year":2024},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:bf00ff4485b834fb654948aa9278f0dc2d6d9259a759c364bfed8a0446ab1236","observation_id":"fbba1b2c-278b-4e3a-aaf6-1041f7aafe93","resolution":{"observed_at":"2026-05-17T19:30:10.861349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3","venue":null,"work_id":"a1136d9b-d664-4e47-99eb-edff216ef30a","year":2022},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:8d83e7dd816c7df3c914b7d0a99e1718eb1edb3db4dc2d18ac4dd3f4455c65ac","observation_id":"ea5c2677-31b9-460b-abf0-78f7a044a282","resolution":{"observed_at":"2026-05-17T19:30:10.864215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cvm-net: Cross-view matching network for image- based ground-to-aerial geo-localization","venue":null,"work_id":"f72bf6b5-c27a-47cd-b62e-1a4fa12da2c5","year":2018},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:e2d576b9a3eae8e79ac3ce9fb4e41f97225995a8661057937fb19e0ab3ebc424","observation_id":"806b1ad1-5c8b-4d0a-b1a4-90c8271e8821","resolution":{"observed_at":"2026-05-17T19:30:10.855540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.04997","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:39:50.774737Z","title":"Llm2clip: Powerful language model unlock richer visual representation.arXiv preprint arXiv:2411.04997","venue":null,"work_id":"78f35a1a-a9da-43e6-9ad3-31eee39680d6","year":2024},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:a2f8a864d359620f4f26ceafe8cb30fe2a49d17f9ff26bb8c25869a8fe8c637b","observation_id":"1b7bcdb3-3508-474e-b609-30cbbcfd138f","resolution":{"observed_at":"2026-05-11T10:06:03.142149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":"2d31e411-692a-4dd0-9348-9fcaf2892e98","year":null},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:eb017846a5f731663e7e4af58f16887983ec2a43a770062e562f90fb75a570d3","observation_id":"30baefd4-4190-4a6a-ac33-3b71ddb4b5fc","resolution":{"observed_at":"2026-05-17T19:30:10.850110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":"f5131573-bf3c-42f3-bdf2-e679b1f8d9ab","year":null},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:c991e66ed4b81b15bc55c4b41e498526a580f949f532a92e46efcf9c03bf91ff","observation_id":"1e1a664b-3957-4cea-9d5a-f04e26296ff4","resolution":{"observed_at":"2026-05-17T19:30:10.794618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptive latent diffusion model for 3d medical image to image translation: Multi- modal magnetic resonance imaging study","venue":null,"work_id":"d7ee8464-7055-4833-aa8c-10e9a6dc9dfc","year":2024},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:85a795beaa0e89749233b6ef7655693ae2892e49da947b03b858bb3824f6439b","observation_id":"4f257d07-96d8-4847-b397-1dba4e768e66","resolution":{"observed_at":"2026-05-17T19:30:10.791415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vilt: Vision- and-language transformer without convolution or region su- pervision","venue":null,"work_id":"fd2da9c6-0e96-4648-b70e-6b96156bb5e9","year":2021},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:c93c88be5d62a4be0a7811c4c914bc25401e4ec25f6c1d5f76d1e87c71556aea","observation_id":"cf5e291e-01f4-4f18-9d1f-1b56f7e49ca1","resolution":{"observed_at":"2026-05-17T19:30:10.844184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi- modal data-efficient 3d scene understanding for autonomous driving.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"b17eb8be-718c-4203-aecf-8bc2410aa39e","year":2025},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:c3f4be3e82824d6ecb6b9471725056a2ae705fb5f8b3898076968ccdb08cf1b8","observation_id":"f86c3c47-9acb-4dae-b770-2f764405f7b6","resolution":{"observed_at":"2026-05-17T19:30:10.847140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation.Advances in neural infor- mation processing systems, 34:9694–9705","venue":null,"work_id":"d9a5e701-f028-4f51-b7b9-cc93feb75a84","year":2021},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:f595668232002a63fee9eee8fe942d5c3c481f34d8fe66de8bd5a4bb65410e08","observation_id":"6fe628fc-1c29-4371-8f1b-992d24d40711","resolution":{"observed_at":"2026-05-17T19:30:10.767551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"fcc4692a-881e-42aa-a118-6dd2df272d22","year":2022},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:d592a60227ec1d6feeec491defeab1c7e01094d2cae442067ce74c85b88f07d1","observation_id":"dcaf2212-d393-4b30-8575-59120121086c","resolution":{"observed_at":"2026-05-17T19:30:10.867668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"9cf9d676-edc9-4b4a-b10b-63352c4af88c","year":2023},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:facf08add7bc4c16276c7b9c11fd99d5ae56ae9ad76ce0609ee1f53cc353d9b3","observation_id":"7f773f39-253c-463b-9752-157b2db5f67a","resolution":{"observed_at":"2026-05-17T19:30:10.835238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05195","last_updated":"2025-07-21T21:23:51Z","snapshot_observed_at":"2026-07-06T19:47:07.442952Z","submitted_at":"2024-11-07T21:39:51Z","title":"Exploring How Generative MLLMs Perceive More Than CLIP with the Same Vision Encoder","version":3},"cited_work":{"arxiv_id":"2411.05195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.05195","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On erroneous agreements of clip image embeddings","venue":null,"work_id":"40f3b736-a128-4a6d-95d6-ad3249db6678","year":2024},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"cited_paper":"/paper/2411.05195","citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:6a1b9a785ccbb855ef45c086bb698016dd00fadf0be8e7f48c76e954ab02c1ca","observation_id":"13ac5c34-8a8f-4d67-b03e-e2dceb445798","resolution":{"observed_at":"2026-05-11T10:06:03.125221Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view image geolocalization","venue":null,"work_id":"0e483610-31de-4a79-aaf7-6b3489883e69","year":2013},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:abaf02889b01dd737ad9c5ac2325315d5ed441accab41525cd5bf11cf7b2e757","observation_id":"660e612c-824f-440c-b605-90f21c299fd4","resolution":{"observed_at":"2026-05-17T19:30:10.838274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.175571Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"a778ff6a-f7fb-434e-bacd-489db651bc50","year":2023},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:9914ceb0125d87c0e7bbc9680b0a6638a16033b025972e899af5589f1ac31ed4","observation_id":"4de0be30-099f-46e8-8ef3-cc78178eff8d","resolution":{"observed_at":"2026-05-17T19:30:10.825426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lending orientation to neural networks for cross-view geo-localization","venue":null,"work_id":"591ab564-fef1-4b89-a4d6-ae1bbcf87a83","year":2019},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:e0b9062c5aac5fe809cece3c6995aa1956e076f4eefa1ddea00d60edc667a264","observation_id":"547df760-e92e-4d22-aadb-c9ee28aea54e","resolution":{"observed_at":"2026-05-17T19:30:10.907518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Delving into multi-modal multi-task foun- dation models for road scene understanding: From learning paradigm perspectives.IEEE Transactions on Intelligent Ve- hicles","venue":null,"work_id":"99e19188-6be7-4d50-87a6-8c085a5fb388","year":2024},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:d93bc2f19db5372739bacce63e476480f3719ab2c6da7a19ced36bdd0281e9e8","observation_id":"f97c42fd-d0ac-442f-9219-061b4b0f42bc","resolution":{"observed_at":"2026-05-17T19:30:10.822243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":"2504.05299","doi":"10.18653/v1/2025.acl-long.718","metadata_source":"pith","pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmolVLM: Redefining small and efficient multimodal models","venue":"cs.AI","work_id":"810cc87f-f6bd-4443-9673-5e30982426b9","year":2025},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:5351fb0a54201ab78081fef2631b1f64ea6fe5f58e1049c40baae3afe4a7ceb4","observation_id":"bf5d5300-f2f7-4088-a80f-820020dbe578","resolution":{"observed_at":"2026-05-13T20:23:51.804797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In defense of dual-encoders for neural ranking","venue":null,"work_id":"7a61b824-00df-4f8d-94eb-5b2c4ec75ea3","year":null},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:f93b753f60ac774a6313e86bd24b019d59294ad19f1909aaef3fbbc312d5c082","observation_id":"7ab15c9b-991f-40d3-8155-23cb3dbd2f4f","resolution":{"observed_at":"2026-05-17T19:30:10.828436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:b112201ae1019d8d213f3f5053558390adb52a988c4d30b9027c37a9d107f91c","observation_id":"198a5989-459b-4fe9-93e9-f6a7de73db78","resolution":{"observed_at":"2026-05-11T10:06:03.094262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback.Ad- vances in neural information processing systems, 35:27730– 27744","venue":null,"work_id":"f6ca8f3f-0f7e-4843-a396-fb8099b36a1c","year":2022},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:5d679413c796e598ae5347e26310304fc1b89a7433d578887fbcad91710bc1a9","observation_id":"1bef32d1-59fb-4554-bae2-964262726431","resolution":{"observed_at":"2026-05-17T19:30:10.818883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"b8773064-dc5c-48f0-a2ac-399cf407e797","year":2021},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:49626268d222eae86884f75177ea1c893b546e2658e501f7077591df31280992","observation_id":"68229d8d-e24b-4513-805c-b9d78f5dc78e","resolution":{"observed_at":"2026-05-17T19:30:10.921666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view image synthesis using conditional gans","venue":null,"work_id":"36f57f81-3ddb-4672-a040-ef8cf2c16617","year":2018},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:966b937fb329aca27655b28e08be8d0381449cf79c47ddfe92f8fd2d2ce076e8","observation_id":"a43f8fce-ba9c-4497-808f-b41ee9b78c9c","resolution":{"observed_at":"2026-05-17T19:30:10.812052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi- modal vision pre-training for medical image analysis","venue":null,"work_id":"bec27ed1-082e-49e1-af56-41a5cb2287e7","year":2025},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:29fc0ad498c7f61d6480c1c5af2d7cc14a02bf5c17685ab9dfbcf48b5a86c744","observation_id":"6cd44da2-16a8-4616-99a0-aabbb97e62bc","resolution":{"observed_at":"2026-05-17T19:30:10.815525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toolformer: Lan- guage models can teach themselves to use tools.Advances in Neural Information Processing Systems, 36:68539–68551","venue":null,"work_id":"aaa54778-c2eb-4dff-a44e-2af85097b946","year":null},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:db3f764c82d5d6c7e8c266d04e011f56adedb283f863d4ce66e30fe859edfcc3","observation_id":"eea14c1a-80f8-4553-b7e5-5a8da5896006","resolution":{"observed_at":"2026-05-17T19:30:10.831959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatial- aware feature aggregation for image based cross-view geo- localization.Advances in Neural Information Processing Systems, 32","venue":null,"work_id":"3dfa498a-0e0f-4865-9b06-6003c635b17c","year":2019},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:fd8b3a221eae6c5d90aa15ca21159e89e6350ef6e29ea9e215f541ea5039546f","observation_id":"2015a3b4-c445-4e5e-9c86-15ea364112d4","resolution":{"observed_at":"2026-05-17T19:30:10.841392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimal feature transport for cross-view image geo- localization","venue":null,"work_id":"a283516c-ef94-4a2b-820b-74b187f66684","year":2020},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:a7bf04f71aceff5c03fc443805748535706a1f367011c993b12d683c6b6f3eb5","observation_id":"164ae84f-a7da-4211-ad61-f88ae0659f26","resolution":{"observed_at":"2026-05-17T19:30:10.852865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:0ec8f1f5b6915a672c6290b3828b876036be8277ec6723af71009d77d86dab9e","observation_id":"a98338c8-6ea8-4977-88cf-361a9dc2b3e2","resolution":{"observed_at":"2026-05-11T10:06:03.087498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need.Advances in neural information processing systems, 30","venue":null,"work_id":"1d73cb8e-bd95-49eb-8d35-3338aa1c3043","year":2017},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:50af44f74889011e1073fcd35ae4b230c03d7c43404042b51a4fc40eeea235a9","observation_id":"c33741d6-c638-41c4-9229-84ac3a8dec2a","resolution":{"observed_at":"2026-05-17T19:30:10.889461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:7b48bfee0bed5904531e4ab63e602ac1bd5e84a50edec6a5808f068533f13d60","observation_id":"42b1840e-9d3c-4386-b0e7-af67e2b51ee1","resolution":{"observed_at":"2026-05-11T10:06:03.068874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:0345aff11e965a1ef06589d6087d903d0338921bf553222bb5333798a4f3615d","observation_id":"1fc1c867-a1dd-4fab-a466-0cb8a3bb4141","resolution":{"observed_at":"2026-05-11T10:06:03.102161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image and object geo-localization.International Journal of Computer Vision, 132(4):1350–1392","venue":null,"work_id":"1742df1e-cab3-45e9-ba07-74a0302737cd","year":2024},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:39c2be7e3e54728bd92f90f02f73e29eb6154b999a10141c246de60e1189d13b","observation_id":"3e5070c8-a9d0-4c2d-9062-e96810655f7e","resolution":{"observed_at":"2026-05-17T19:30:10.806187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wide-area image geolocalization with aerial reference im- agery","venue":null,"work_id":"63cb1dd1-8d5f-4bcd-a51d-1cbba3fe1e0f","year":2015},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:b4fbd1bdd9066ab3ec0903742cc2c55b1e70111b999284b158b7058ae7700da8","observation_id":"aaebdf15-94e8-42dd-80f4-0b2878d9ee40","resolution":{"observed_at":"2026-05-17T19:30:10.918202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A semantic-enhanced multi-modal remote sens- ing foundation model for earth observation.Nature Machine Intelligence, pages 1–15","venue":null,"work_id":"cd6b6c86-da0c-4d9c-9504-ae8e7617c245","year":2025},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:b1bca2fe63fcf82b239bfd8631878913ecf916f45086a71ecdf8d4e121dca4d3","observation_id":"62c6e12e-80e3-436c-a22b-0f5bc5a0d520","resolution":{"observed_at":"2026-05-17T19:30:10.911101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view panorama image synthesis.IEEE Transactions on Multimedia, 25: 3546–3559","venue":null,"work_id":"335c68b4-2c5f-4d6c-af6b-7c2e3cf5eaa9","year":2022},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:8dada286c373447ca1c9f1e62f32f833d3335ae3fc0846aa7a64f9e2b4960eed","observation_id":"509df574-1fa4-4c7a-88dc-1dfbe99033de","resolution":{"observed_at":"2026-05-17T19:30:10.809078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view geo-localization with layer-to-layer transformer.Advances in Neural Information Processing Systems, 34:29009–29020","venue":null,"work_id":"ae639766-1fb7-4634-a2c4-69f9c16c6417","year":null},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:32d1b6d655162f190701bb36a33490d51eafa3fc9492444ee979d435641eaf33","observation_id":"ec7bd879-6696-495f-b311-be91c2c1bb44","resolution":{"observed_at":"2026-05-17T19:30:10.797761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view image geo- localization with panorama-bev co-retrieval network","venue":null,"work_id":"968bbf83-7e94-4a14-92f9-52f4902b7edb","year":2024},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:0da093636bbf1038de3aacecb7b317c3a0d86999da242b0472014820ceb1012f","observation_id":"0f65dcb1-f372-4242-9cb2-d7a1dd9ba1ce","resolution":{"observed_at":"2026-05-17T19:30:10.800578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Where am i? cross-view geo-localization with natural language descrip- tions","venue":null,"work_id":"3cc3996e-9a8d-4bcc-a239-7f6e977f0fb7","year":2025},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:76f82fed8cb85ee3d3212097efa90d8243176e3c155669fdab0aa315aeab2add","observation_id":"b6da84ac-ff7d-4c7f-b16c-f61498751b53","resolution":{"observed_at":"2026-05-17T19:30:10.803510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-grained vi- sion language pre-training: Aligning texts with visual con- cepts","venue":null,"work_id":"6da559a1-2459-4049-a566-df96090bc587","year":2022},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:af856909b3a7ae4c7843242631bb5dd0a7f0bb66ac3621fe41d508181dab2107","observation_id":"c10329b8-9170-4f21-bdbf-22f4bf68703b","resolution":{"observed_at":"2026-05-17T19:30:10.914540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"273543af-7742-433d-9748-831a46cac080","year":2023},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:38ba3e7777d3d21a57cf53daeaf4687332f50ed7b3a00fb9dab3f21ce1cce4bb","observation_id":"e86013c2-133b-4adb-83bd-e2e6e0c52c70","resolution":{"observed_at":"2026-05-17T19:30:10.785094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-view geo-localization via learning disentangled geometric layout correspondence","venue":null,"work_id":"715f258b-9061-4b32-b95d-d3efa31dc8b8","year":2023},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:eb792be9608cd4edae74f9f74556a3e3e7260dbdae25627d98b3dbddf37c6273","observation_id":"0cadc3b4-1c7a-4a20-adfb-b0b810c48d0b","resolution":{"observed_at":"2026-05-17T19:30:10.788286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross- view image sequence geo-localization","venue":null,"work_id":"34e1a28c-ebda-4887-8e83-6ed724afd5b6","year":2023},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:277230a3988ccc1d58e8a3130a98973021c8a003ad1d0c551690590e5f25f507","observation_id":"3e971db1-650e-4db2-a25e-5bac26180ba5","resolution":{"observed_at":"2026-05-17T19:30:10.778170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geodtr+: Toward generic cross-view ge- olocalization via geometric disentanglement.IEEE Trans- actions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"903e7383-b8a0-4c3c-b7d8-7c565c009ec8","year":2024},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:bc913359fc6eb27c23ac29a55af2a2cb730f6044870274fef20ea6b971afce53","observation_id":"1033dea7-729c-45b1-bbe6-97fec9b30bb5","resolution":{"observed_at":"2026-05-17T19:30:10.904271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vici: Vlm-instructed cross-view image-localisation","venue":null,"work_id":"b396a5a6-e835-4d1b-bf5f-cc099ffb7a89","year":2025},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:efc308175150afb33a5e7a6eeb958bfca41d744174ef2c95cfc7b5410d236db3","observation_id":"3980a872-6fa9-4135-bc5b-e0048f1f15ed","resolution":{"observed_at":"2026-05-17T19:30:10.774946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"University- 1652: A multi-view multi-source benchmark for drone- based geo-localization","venue":null,"work_id":"2751931e-d76f-4a6c-9e07-1187b8f1c198","year":null},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:1c92f0a49ae72df6c7c67843b893334fd960d75b94c4fed01168350dd695bb25","observation_id":"3e47ac36-6c49-4238-812d-c918c76cddb1","resolution":{"observed_at":"2026-05-17T19:30:10.781740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vigor: Cross- view image geo-localization beyond one-to-one retrieval","venue":null,"work_id":"2887c904-5781-43fa-86bc-bbf68e1915b3","year":2021},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:5d816096af7c09b791ec6128ecee74f9ab67e9d07376c87e1b41801be61bbc40","observation_id":"5aa9a884-8122-4486-b5e2-d5420d0a2125","resolution":{"observed_at":"2026-05-17T19:30:10.896304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transgeo: Trans- former is all you need for cross-view image geo-localization","venue":null,"work_id":"6e603a7f-5567-4187-b952-770a44e23ad7","year":2022},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:16d93dcbaead3aad41d47d49d62a99eaff764839966914b3a51f7943cf70e607","observation_id":"dc273044-65d1-408a-b528-d38527474df2","resolution":{"observed_at":"2026-05-17T19:30:10.771439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01572","last_updated":"2023-02-03T06:50:51Z","snapshot_observed_at":"2026-07-06T14:48:00.491849Z","submitted_at":"2023-02-03T06:50:51Z","title":"Simple, Effective and General: A New Backbone for Cross-view Image Geo-localization","version":1},"cited_work":{"arxiv_id":"2302.01572","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.01572","snapshot_observed_at":"2026-06-30T10:44:37.379894Z","title":"arXiv preprint arXiv:2302.01572 , year=","venue":null,"work_id":"a56fc9be-78cc-4ca3-a025-6cfb18dfe9c2","year":2023},"citing_paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T15:39:17.229872Z"},"links":{"cited_paper":"/paper/2302.01572","citing_paper":"/paper/2604.10721"},"observation_digest":"sha256:f12495cb4368cb16570fa17168514ca41a7ec9fa70fcefa9953070b662599c77","observation_id":"aff193ed-4a57-47eb-88ca-aae43219a3c2","resolution":{"observed_at":"2026-05-11T10:06:03.110441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.10721","last_updated":"2026-04-12T16:40:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T15:18:58.118842Z","submitted_at":"2026-04-12T16:40:02Z","title":"Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":49},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2604.10721."}