{"as_of":"2026-08-07T16:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d3c4229ef2312afcb7b7057104aae2b9a6dbb21cf0c8a2614d68e3c6f2fe29e","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:52:10.218789Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:12:10.857306Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T23:06:20.239381Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01277","snapshot_observed_at":"2026-08-06T23:12:10.857306Z","title":"Geolocsft: Efficient visual geolocation via supervised fine-tuning of multimodal foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19406","last_updated":"2025-06-24T08:20:08Z","snapshot_observed_at":"2026-08-06T23:05:02.113195Z","submitted_at":"2025-06-24T08:20:08Z","title":"A Global-Local Cross-Attention Network for Ultra-high Resolution Remote Sensing Image Semantic Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:10.857306Z"},"links":{"cited_paper":"/paper/2506.01277","citing_paper":"/paper/2506.19406"},"observation_digest":"sha256:13ed3664ea89375d821721724975207337f9f931cd6835b26cdf8032f7e4fc8b","observation_id":"5da9a71f-b019-499b-aeee-179f85ab3b52","resolution":{"observed_at":"2026-08-06T23:12:10.857306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01277","snapshot_observed_at":"2026-08-06T23:00:29.112400Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20688","last_updated":"2025-06-25T03:23:16Z","snapshot_observed_at":"2026-08-06T22:54:26.385173Z","submitted_at":"2025-06-25T03:23:16Z","title":"Building Lightweight Semantic Segmentation Models for Aerial Images Using Dual Relation Distillation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:29.112400Z"},"links":{"cited_paper":"/paper/2506.01277","citing_paper":"/paper/2506.20688"},"observation_digest":"sha256:1c8b453a0c6b0553b90903c745459a43ae2531025b5850f37085934b1110c377","observation_id":"c1b68c6f-60f2-4d40-b263-be1b4624e2e8","resolution":{"observed_at":"2026-08-06T23:00:29.112400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01277","snapshot_observed_at":"2026-08-06T21:24:31.913301Z","title":"Geolocsft: Efficient visual geolocation via supervised fine-tuning of multimodal foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00363","last_updated":"2025-07-01T01:29:31Z","snapshot_observed_at":"2026-08-07T00:25:59.881057Z","submitted_at":"2025-07-01T01:29:31Z","title":"GDGS: 3D Gaussian Splatting Via Geometry-Guided Initialization And Dynamic Density Control","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:24:31.913301Z"},"links":{"cited_paper":"/paper/2506.01277","citing_paper":"/paper/2507.00363"},"observation_digest":"sha256:0bf055d688a11e9a2f94bd3eab57c5fcfccc354d42253a813a16283ac3768e44","observation_id":"0a34a1ef-010f-4b43-8de7-cf7d9ee70961","resolution":{"observed_at":"2026-08-06T21:24:31.913301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":"2506.01277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01277","snapshot_observed_at":"2026-07-01T23:06:20.239381Z","title":"arXiv preprint arXiv:2506.01277 , year=","venue":null,"work_id":"fd4414ae-7062-4d6e-90d9-b1dc4078e7d5","year":2025},"citing_paper":{"arxiv_id":"2508.01608","last_updated":"2026-05-15T21:06:13Z","snapshot_observed_at":"2026-07-06T22:06:58.031276Z","submitted_at":"2025-08-03T06:04:33Z","title":"From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T23:49:59.795575Z"},"links":{"cited_paper":"/paper/2506.01277","citing_paper":"/paper/2508.01608"},"observation_digest":"sha256:6c741c0dec4da10197273fbe4fe5fb16b91de0464fb84df72947ff16ddbae1bb","observation_id":"4aab417b-4cd4-4650-9ded-b40c41c22580","resolution":{"observed_at":"2026-05-21T23:50:47.271597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":"2506.01277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01277","snapshot_observed_at":"2026-07-01T23:06:20.239381Z","title":"arXiv preprint arXiv:2506.01277 , year=","venue":null,"work_id":"fd4414ae-7062-4d6e-90d9-b1dc4078e7d5","year":2025},"citing_paper":{"arxiv_id":"2606.07642","last_updated":"2026-06-01T18:46:43Z","snapshot_observed_at":"2026-08-01T21:19:56.423505Z","submitted_at":"2026-06-01T18:46:43Z","title":"Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for Wheelchair Accessibility Assessment from Street View","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T14:42:47.815192Z"},"links":{"cited_paper":"/paper/2506.01277","citing_paper":"/paper/2606.07642"},"observation_digest":"sha256:8d88ee92440dd9cef369698873d3058f83e38e04b19e51953806f68e5c84da7f","observation_id":"556d334e-529f-4853-a0ff-ca369f038b59","resolution":{"observed_at":"2026-07-01T23:06:20.241225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01277","snapshot_observed_at":"2026-07-30T22:45:19.083071Z","title":"Geolocsft: Efficient visual geolocation via supervised fine-tuning of multimodal foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24856","last_updated":"2026-07-26T02:51:53Z","snapshot_observed_at":"2026-08-07T06:47:06.770145Z","submitted_at":"2026-07-26T02:51:53Z","title":"DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-30T22:45:19.083071Z"},"links":{"cited_paper":"/paper/2506.01277","citing_paper":"/paper/2607.24856"},"observation_digest":"sha256:7d939089483238f12f665c2da1e2d1f789eebc23e2af86ac34cfddad8b9b87dd","observation_id":"33241b1a-4fed-42af-80bf-13ec998b5cfb","resolution":{"observed_at":"2026-07-30T22:45:19.083071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01277/citation-record","integrity":"/paper/2506.01277/integrity","json":"/paper/2506.01277/citation-record.json","paper":"/paper/2506.01277"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T11:52:08.326032Z","title":"Learning transferable visual models from natural language supervision.arXiv preprint arXiv:2103.00020, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.326032Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:254106d8eab177fef676c0ec30c5fded59e54a97cd938060d31b4411cc8d8192","observation_id":"5b870ec5-2ecf-4f1f-9453-a203fb34e9ec","resolution":{"observed_at":"2026-08-07T11:52:08.326032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:13.289589Z","title":null,"venue":null,"work_id":"d4be31f2-215e-4efa-88bf-bfa8198ee3d9","year":2008},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.362373Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:3e3b08eed007bb69327d3e2e86516782c0b6fe0afa0df8afd3e94dfc44e6cfd2","observation_id":"6a14bccb-dcf5-45f6-b2a3-7a98fa9acb10","resolution":{"observed_at":"2026-08-07T11:52:13.349011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:08.387126Z","title":"PlaNet - photo geolocation with con- volutional neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.387126Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:4d7163446f691224d77a7fe3c255a31211dea2262f3dd75a1c6751ae58db2a61","observation_id":"1141b9f7-2500-4a76-8e86-177824a35b62","resolution":{"observed_at":"2026-08-07T11:52:08.387126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05845","last_updated":"2024-05-28T22:00:10Z","snapshot_observed_at":"2026-08-01T06:43:14.847542Z","submitted_at":"2023-07-11T23:36:49Z","title":"PIGEON: Predicting Image Geolocations","version":6},"cited_work":{"arxiv_id":"2307.05845","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.05845","snapshot_observed_at":"2026-08-07T11:52:10.837728Z","title":"PIGEON: Predicting Image Geolocations","venue":"cs.CV","work_id":"1d23e233-24e7-44bd-bde8-a9618993a59c","year":2023},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.433343Z"},"links":{"cited_paper":"/paper/2307.05845","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:347f049502a2e99f683d26ad0f6770398a99583c93c34fd51cd0ca0147330c1f","observation_id":"148ace07-28fb-49c5-85a7-6ba3ad394ec2","resolution":{"observed_at":"2026-08-07T11:52:10.869770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09474","last_updated":"2024-08-18T13:39:43Z","snapshot_observed_at":"2026-08-05T18:35:37.834773Z","submitted_at":"2024-08-18T13:39:43Z","title":"Image-Based Geolocation Using Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09474","snapshot_observed_at":"2026-08-07T11:52:08.551981Z","title":"Image-based geolocation using large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.551981Z"},"links":{"cited_paper":"/paper/2408.09474","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:8a1770b830fda104e9285986d64cfbd33364107a5807c813fd2447ec321aa97c","observation_id":"fee7286f-50b1-4b48-a43b-13fa9eb5c07f","resolution":{"observed_at":"2026-08-07T11:52:08.551981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T11:52:08.601226Z","title":"Chain-of-thought prompting elicits reasoning in large language models.arXiv preprint arXiv:2201.11903, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.601226Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:2206fd806bf53f4ca686f9510df04640b6fa06177d71707b1fcd6e8eeda35fba","observation_id":"a2dc9744-dbad-4f52-852a-7bfcb6c5134f","resolution":{"observed_at":"2026-08-07T11:52:08.601226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T11:52:08.630800Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.630800Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:fda354474d5ba3702c8ca0a0b02ee5c5f30efe73f29473edb6afe52afa840843","observation_id":"7b13da83-2661-40bd-b0f2-60b00ee1c4f7","resolution":{"observed_at":"2026-08-07T11:52:08.630800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:13.188486Z","title":"Neural network ensembles.IEEE Transactions on Pattern Analysis and Machine Intelligence, 12(10):993–1001, 1990","venue":null,"work_id":"ed10b193-0363-476c-afb5-e3011a861516","year":1990},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.677012Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:afc609672505c4eca7966db2bc3bb8e5ac8d294ec1df302f36eb2e1350231c40","observation_id":"30c03c75-74da-45cd-a91b-d1218652f3af","resolution":{"observed_at":"2026-08-07T11:52:13.244819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:08.724712Z","title":"Shamma, Gerald Friedland, Benjamin Elizalde, Karl Ni, Douglas Poland, Damian Borth, and Li-Jia Li","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.724712Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:e1f5d09f4eb44b83de75dff2b11ca7c654292cbee0a92f1746e56b1a3ed8ae73","observation_id":"a64f0ec5-2882-4c39-8759-e00d3c24ef5a","resolution":{"observed_at":"2026-08-07T11:52:08.724712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04249","last_updated":"2023-03-07T21:47:58Z","snapshot_observed_at":"2026-07-06T14:59:57.727357Z","submitted_at":"2023-03-07T21:47:58Z","title":"Where We Are and What We're Looking At: Query Based Worldwide Image Geo-localization Using Hierarchies and Scenes","version":1},"cited_work":{"arxiv_id":"2303.04249","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.04249","snapshot_observed_at":"2026-08-07T11:52:10.590806Z","title":"Where We Are and What We're Looking At: Query Based Worldwide Image Geo-localization Using Hierarchies and Scenes","venue":"cs.CV","work_id":"d8dbfe6d-243d-4b70-80ba-ff2fd3941743","year":2023},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.764186Z"},"links":{"cited_paper":"/paper/2303.04249","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:701b3ef19b96b45b97cc7715733300d22a2f3179eec4210edec7db946cbca65b","observation_id":"8dcf04f6-b1eb-42bb-9bd8-6608e1952def","resolution":{"observed_at":"2026-08-07T11:52:10.616398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:13.037849Z","title":"The Mapil- lary Vistas dataset for semantic understanding of street scenes","venue":null,"work_id":"b298ae9e-5784-4d58-8928-a7d6954ab6b3","year":2017},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.801352Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:5bb856225740a8fd35a46a68420a8141a83c7bc1db76306098e4f62fc5471f76","observation_id":"eb76507a-c259-486b-a3ce-9e3b118146cc","resolution":{"observed_at":"2026-08-07T11:52:13.100674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.921169Z","title":"GeoNames geographical database","venue":null,"work_id":"e291033d-9b95-4501-a7d1-76f1ec2484b8","year":2025},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.826571Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:f7184bac5325ba734ae28764f4537600bd8dfd47b18f1bee45286870dca13402","observation_id":"25452abf-1357-45ad-88ff-b01d1e19727f","resolution":{"observed_at":"2026-08-07T11:52:12.947008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:52:09.047711Z","title":"Qwen2.5-VL technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.047711Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:7b5310c25a166536d53c97cf567b4f96796e5bc12936b0782076a2543b23f273","observation_id":"5169bda4-4f7d-42c3-a9a2-4dcc23558192","resolution":{"observed_at":"2026-08-07T11:52:09.047711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T11:52:09.081528Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.081528Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:60b7c6924b7d2f2d52a80661b0503c2a72b43be6ea00e2c61d179fda216d5e72","observation_id":"54ddb3a1-3421-4792-a162-fd35c6d2a87d","resolution":{"observed_at":"2026-08-07T11:52:09.081528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18873","last_updated":"2024-04-29T17:06:44Z","snapshot_observed_at":"2026-07-06T18:07:10.639325Z","submitted_at":"2024-04-29T17:06:44Z","title":"OpenStreetView-5M: The Many Roads to Global Visual Geolocation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18873","snapshot_observed_at":"2026-08-07T11:52:09.120531Z","title":"OpenStreetView-5M: The many roads to global visual geolocation.arXiv preprint arXiv:2404.18873, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.120531Z"},"links":{"cited_paper":"/paper/2404.18873","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:f101f204a9adb79f233176abd9747435c401f7c5321f61bf53ef216c9f9b22f6","observation_id":"9ad4f2a6-8671-4596-87c9-e9dc77b2b336","resolution":{"observed_at":"2026-08-07T11:52:09.120531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.824477Z","title":"The Claude 3 model family: Opus, Sonnet, Haiku","venue":null,"work_id":"5a378a6a-80ef-4096-b301-16dc1a78aa91","year":2025},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.193032Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:316fbcbad141ce2f453b0842b51e4f410b77f2988a0e09faeec35b43e929d51e","observation_id":"193b1e22-a3e6-49ce-8702-3dc16a604b34","resolution":{"observed_at":"2026-08-07T11:52:12.868679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T11:52:09.261284Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.261284Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:5a75e3b5f042feaae7ef47a4e39b89264d0d2be8d587fa9479c092090ed94786","observation_id":"7631d502-cc44-4fdb-9cae-f977578e16e5","resolution":{"observed_at":"2026-08-07T11:52:09.261284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.727369Z","title":"Mistral-Small-3.1-24B-Instruct-2503","venue":null,"work_id":"65544a3e-78f9-4f43-ac8d-c7a95cef6d57","year":2025},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.302998Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:6deeb6a2fe0ed16c6fb62c6c8fc2789ee6425d08651b6008916a294531d08b94","observation_id":"b8c927a4-7674-4873-acef-447b02dfb975","resolution":{"observed_at":"2026-08-07T11:52:12.768597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.04838","last_updated":"2017-05-13T14:43:02Z","snapshot_observed_at":"2026-08-04T03:05:02.256122Z","submitted_at":"2017-05-13T14:43:02Z","title":"Revisiting IM2GPS in the Deep Learning Era","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.04838","snapshot_observed_at":"2026-08-07T11:52:09.371329Z","title":"Revisiting IM2GPS in the deep learning era.arXiv preprint arXiv:1705.04838, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.371329Z"},"links":{"cited_paper":"/paper/1705.04838","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:36cf39cd33d56c5f438452458ec25d2ca6ea0c9e9fe0dbaf430a9439afd13fad","observation_id":"00ff3373-43a2-4640-9a60-16d45423daa3","resolution":{"observed_at":"2026-08-07T11:52:09.371329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T11:52:09.515725Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.515725Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:16a7d17d980fb7c5a8a4bbb0f6b70c15381f2805105b61bc9402ce42ca3193b7","observation_id":"fe163f24-9bf9-4a1e-9068-23c0b9512cd1","resolution":{"observed_at":"2026-08-07T11:52:09.515725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T11:52:09.555930Z","title":"Consensus- Geo","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.555930Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:2822b029fb89e667fc3df84c931681b5c7a729ea02917e150196c7fc711b342d","observation_id":"4c703f5e-d585-4cf8-9785-e4d83a4ec20f","resolution":{"observed_at":"2026-08-07T11:52:09.555930Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06781","last_updated":"2024-12-09T18:59:04Z","snapshot_observed_at":"2026-08-04T15:57:31.052276Z","submitted_at":"2024-12-09T18:59:04Z","title":"Around the World in 80 Timesteps: A Generative Approach to Global Visual Geolocation","version":1},"cited_work":{"arxiv_id":"2412.06781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06781","snapshot_observed_at":"2026-08-07T11:52:10.374159Z","title":"Around the World in 80 Timesteps: A Generative Approach to Global Visual Geolocation","venue":"cs.CV","work_id":"2f6aa69b-7435-430b-8f95-0602cfddd3e9","year":2024},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.473416Z"},"links":{"cited_paper":"/paper/2412.06781","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:2b7808eee71f521b52cb260b75d190bfbc4e4e4612eaf0d6a8d96e9ace4962b8","observation_id":"e70fda6e-38f2-403b-a5b8-43f8a2764ae7","resolution":{"observed_at":"2026-08-07T11:52:10.415712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.641716Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"c5c39428-4834-41b2-b2dd-1056d4d50342","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.594635Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:4c53572bda21d0fe23666480cd3ca998aa0c215bcc0fd97aefa580282c44084d","observation_id":"7dbbf803-2ed1-4664-ac0f-00481042e4bb","resolution":{"observed_at":"2026-08-07T11:52:12.675504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.560026Z","title":"Guidelines: • The answer NA means that the paper has no limitation while the answer No means that the paper has limitations, but those are not discussed in the paper","venue":null,"work_id":"d9b45eac-9f55-4958-9ed9-b3f9009cf646","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.627183Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:3f3a32cde0c24590ed3ff377c67017f7e3d0a4cd4a83a3a71584c24cb487e345","observation_id":"947e2810-6378-40e2-b3cf-419d7b1409a3","resolution":{"observed_at":"2026-08-07T11:52:12.601524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.431751Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"bba09b3a-ecda-457b-b275-932b3914d760","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.687952Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:49c9e9bf3383b6c176f48a775619f6c0433b1d0d795cb8e35181095b3f224b74","observation_id":"9bcd7b9a-f880-435d-aec0-4ad3a7a11462","resolution":{"observed_at":"2026-08-07T11:52:12.486517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.349310Z","title":"The appendices include hyperparameters for SFT and information about computational resources used","venue":null,"work_id":"997ca7a1-2cb9-4b36-907a-31c5a19fe79e","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.751346Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:7d7116f032a13aac0676a1bd0817df43b448c005bba7107c224d83895e2139d3","observation_id":"62811774-990e-4f8c-9518-4fa0e1845b78","resolution":{"observed_at":"2026-08-07T11:52:12.393269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.275377Z","title":"Our appendices provide detailed instructions regarding implementation, hyperparameters, and experimental setup to facilitate reproduction","venue":null,"work_id":"b3f9c6ae-47c8-48e1-80cc-311808d2dad8","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.792357Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:9f7452603426b669c56e0e4b5d7bc99da2d109f8914a187565d313b82f289366","observation_id":"7dc63ab1-963b-4bcd-b217-e92994f77b42","resolution":{"observed_at":"2026-08-07T11:52:12.301578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.195443Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"27a81c63-af6e-42ff-8142-de8871d1fa60","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.842854Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:05d92f64013490c51ff8cc5b622e67d937fd8648a3408bf4797c53953eea4c79","observation_id":"1dba0e3d-4065-44e2-a2ff-01d772224858","resolution":{"observed_at":"2026-08-07T11:52:12.220821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.054432Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"ac16147d-641a-4ec8-ae1f-1e498b972e3d","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.878555Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:55209983230accb7f4794a32bd656056e92e3a613952160a4ee9b9ff13e42313","observation_id":"5cc46a9c-3c83-45bd-a47d-a8079eb9fd12","resolution":{"observed_at":"2026-08-07T11:52:12.110456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.951722Z","title":"We also report model sizes and memory requirements","venue":null,"work_id":"56a42f48-94a9-4b09-89ec-d88c8ec9c661","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.888164Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:1605e9c3db5400e1a8772cd50cbccef9edadabd6d0e70b75f289decb47fa358b","observation_id":"180e1af7-572b-4d03-8655-1beb3d7b8761","resolution":{"observed_at":"2026-08-07T11:52:11.988746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.839129Z","title":"We use publicly available datasets, acknowledge relevant prior work, and are transparent about our methodologies","venue":null,"work_id":"86c19e8d-13ce-410d-8f66-b22295c5283e","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.925377Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:4b39398367304b1bf714032e9607fcb93258377a53125fd1cb5f494889a369ad","observation_id":"13c45ece-fa9c-4e7a-836b-b714c48619b8","resolution":{"observed_at":"2026-08-07T11:52:11.886563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.676194Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"99381cfa-c34c-4597-b92a-cc5299c28cf8","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.978969Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:93eec4e3f312f98a043153d3de0129d90e8409863bd934818ddee2c662566f55","observation_id":"54276147-772a-4883-9c90-95322fe4ce64","resolution":{"observed_at":"2026-08-07T11:52:11.755852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.583501Z","title":"27 Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":"8fb1a132-8387-4f31-92e5-0723f562443c","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:10.027853Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:0f961690eb4970ca85f31229b89fa18f8d0389c419a2e7393016ccf03b3ae72d","observation_id":"bbf48e5d-e190-40dd-9d6b-1ed9331aa26a","resolution":{"observed_at":"2026-08-07T11:52:11.621881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.433916Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"e472879b-8be8-4428-9748-880b2721430a","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:10.068261Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:80f317c264b54c7433877d043655fb7ab903bdb860f1a72a2cb5d928d149186c","observation_id":"3ef73617-d963-4be5-98a5-33ed5ad543e8","resolution":{"observed_at":"2026-08-07T11:52:11.507759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.249571Z","title":"This documentation will be released alongside the dataset","venue":null,"work_id":"feca53e1-6fa0-4c6a-8066-cb018f23914a","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:10.112687Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:3d6024eb18ba15eabf23119d54c6f982ea85f01d93869c4dad653c7ad9252248","observation_id":"8125e676-e808-4062-8bd4-3cebc78c0535","resolution":{"observed_at":"2026-08-07T11:52:11.310523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.093236Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"5650df39-6511-415b-bc80-c3ea809ddf62","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:10.143213Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:79b6bb36de50a82db1ba2cc8a5c754c64b29409bcf9e0ffb5e97ce7ad969aa13","observation_id":"04d645b3-ad62-46d9-a66e-d21e141be845","resolution":{"observed_at":"2026-08-07T11:52:11.158826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:10.938516Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"b46db30f-d8b6-4e0b-8740-1ad435785ce5","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:10.218789Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:8848d9d1cdc8815c691684eb25727a291ca808977165fd657e2dd72e4e61c37f","observation_id":"c14f16c0-6101-481f-82fd-6053b2217ae5","resolution":{"observed_at":"2026-08-07T11:52:10.997861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14702","last_updated":"2024-10-31T09:08:48Z","snapshot_observed_at":"2026-07-06T18:18:43.328203Z","submitted_at":"2024-05-23T15:37:06Z","title":"G3: An Effective and Adaptive Framework for Worldwide Geolocalization Using Large Multi-Modality Models","version":2},"cited_work":{"arxiv_id":"2405.14702","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14702","snapshot_observed_at":"2026-08-07T11:52:10.752165Z","title":"G3: An Effective and Adaptive Framework for Worldwide Geolocalization Using Large Multi-Modality Models","venue":"cs.CV","work_id":"ce5761c1-68fa-4c2b-ad2f-f97f4f549dca","year":2024},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.501464Z"},"links":{"cited_paper":"/paper/2405.14702","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:d1a4003a5f57776ebe9812d2d9288928c6cf0a5109b4790ab35a389da3c26e44","observation_id":"2183609d-e1a8-486a-821c-40d15e3a9070","resolution":{"observed_at":"2026-08-07T11:52:10.788245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T11:52:08.967423Z","title":"arXiv preprint arXiv:2503.19786","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.967423Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:f213e41e41316f719bf4ae360de3c913d0e5a375fd1ace0a836abbadf6afb499","observation_id":"b42b2fe3-b71a-4bb4-a522-2881740e889e","resolution":{"observed_at":"2026-08-07T11:52:08.967423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T11:42:57.090766Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":4,"verified_fuzzy":20},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 6 inbound Pith citation observations for arXiv:2506.01277."}