{"as_of":"2026-08-07T10:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56b3ce6665fc58790db4b4aaf4311d461b4e29a3aa53a74344a9bb596639a903","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:51:53.074321Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04509/citation-record","integrity":"/paper/2507.04509/integrity","json":"/paper/2507.04509/citation-record.json","paper":"/paper/2507.04509"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:58.252492Z","title":"Random sample consensus: A paradigm for model fitting with applications to image analysis and automated cartography,","venue":null,"work_id":"eb9177c7-22bf-41c8-aa63-6c98a923d0be","year":1981},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.260692Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:622b6854b7898c75f20587cbcb393cc6696fe7eb9f131051272e7f2a86bed611","observation_id":"638fde49-e415-43b4-bea2-c236ad418035","resolution":{"observed_at":"2026-08-06T19:51:58.329827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:58.110726Z","title":"Posenet: A convolutional network for real-time 6-dof camera relocalization,","venue":null,"work_id":"398ba6b3-c92d-4f17-871c-aca8136f4540","year":2015},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.355729Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:2f55228d48afd9249755cfe968605b6e75a849548c599660f3c1e5a5b4c753bd","observation_id":"362dd15c-f339-4545-95e0-e0491b5f214d","resolution":{"observed_at":"2026-08-06T19:51:58.175786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:58.004322Z","title":"Image-based localization using lstms for structured feature correlation,","venue":null,"work_id":"bfc30eb8-64d9-4881-9ffc-7e35028a5fbb","year":2017},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.425621Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:89bfd4800ebc9a931870b733d15c8dc49b577b62e4d790e7a816126532012c05","observation_id":"6e56b12d-7ddd-47d2-8c99-9342ec23b794","resolution":{"observed_at":"2026-08-06T19:51:58.050472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.899347Z","title":"Image-based localization using hourglass networks,","venue":null,"work_id":"b11d2d10-5dcd-4b43-98a9-0640832ee7e6","year":2017},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.505453Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:09a8263c0c9cc1600246c3c45b5369263eb1269032961678ca8b0704a6334950","observation_id":"d23f89fb-7306-462d-b63d-0850a8f6cd66","resolution":{"observed_at":"2026-08-06T19:51:57.962733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.736682Z","title":"Modelling uncertainty in deep learning for camera relocalization,","venue":null,"work_id":"46208fe5-d956-4266-b7dc-bcfbab5a2d71","year":2016},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.541883Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:eb2a98779d039ae40a4a5d8a1a852e861d2df8f3a4780f28d23e0164403f9e47","observation_id":"96a5534c-f03e-4db4-9c85-9049bf354677","resolution":{"observed_at":"2026-08-06T19:51:57.814913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.592105Z","title":"Geometric loss functions for camera pose regression with deep learning,","venue":null,"work_id":"a8ffc870-2305-45e2-96c1-4b2d9b8bf963","year":2017},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.649083Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:9b9bc52fbd2b8923be1db861686568141668e7c59f72d49d4feb4dc2919f9556","observation_id":"7d8c9377-86e9-4e77-b200-acd37f6af818","resolution":{"observed_at":"2026-08-06T19:51:57.672985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.484580Z","title":"Vidloc: A deep spatio-temporal model for 6-dof video-clip relocalization,","venue":null,"work_id":"091f808b-dda9-4bcf-9a2c-6117c00d553b","year":2017},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.708062Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:4ab2445cb38cc16ddd7ec1f63052a5a5ba7716404548c7fd512186acf651d617","observation_id":"f5555b2d-9c3e-4b87-825d-3a101907eee6","resolution":{"observed_at":"2026-08-06T19:51:57.529663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.369497Z","title":"Atloc: Attention guided camera localization,","venue":null,"work_id":"ab8a72ec-3c60-4125-a705-2d2bf796a3b4","year":2020},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.797015Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:3711bfafa15ab6ee618e07aa8ca31e2410e20196819203d2feece325b79cd402","observation_id":"c35f19f2-66a0-4abc-b7f7-82da0b72176c","resolution":{"observed_at":"2026-08-06T19:51:57.416565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.222612Z","title":"Effloc: Lightweight vision transformer for effi- cient 6-dof camera relocalization,","venue":null,"work_id":"89178b65-9835-4175-b357-7f75aed90fe1","year":2024},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.878081Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:5774424ea0e3d3093b40d90f351dd90c41017130cdf3a97f9351049548107129","observation_id":"91c298e2-af3a-43ba-8ed9-cfd3119541c6","resolution":{"observed_at":"2026-08-06T19:51:57.300384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16986","last_updated":"2023-10-19T17:59:43Z","snapshot_observed_at":"2026-07-06T15:33:57.659685Z","submitted_at":"2023-05-26T14:41:06Z","title":"NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16986","snapshot_observed_at":"2026-08-06T19:51:50.963143Z","title":"Navgpt: Explicit reasoning in vision-and-language navigation with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.963143Z"},"links":{"cited_paper":"/paper/2305.16986","citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:f8f0898c56b97868054ef24690abdcc207d72e8b81a095cd1f5a55e1cf3d63db","observation_id":"11c3bad6-0b8d-4f07-b6de-e5207a512cf4","resolution":{"observed_at":"2026-08-06T19:51:50.963143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T19:51:51.065164Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.065164Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:66fcf5f1e28e079dc7663bbc05cf8f664038f2d84a496e2709bb91497a69ec57","observation_id":"8a0113dc-d0f3-4fa9-97b9-53026008ccf0","resolution":{"observed_at":"2026-08-06T19:51:51.065164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.131989Z","title":"Extending absolute pose regression to multiple scenes,","venue":null,"work_id":"c4fc76db-6a9f-4991-bb17-abfce6f3851e","year":2020},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.145193Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:3e0485c438af2e893719c7fe5b09dea9c5d6ec7b604b1b51efd087593f76b0a8","observation_id":"ef2c3e76-431d-4d3d-a9c4-372d8b0ea5f7","resolution":{"observed_at":"2026-08-06T19:51:57.175742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:56.977064Z","title":"Coarse-to-fine multi-scene pose regression with trans- formers,","venue":null,"work_id":"062ea124-2ea1-42b7-8028-528488f09760","year":2023},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.218239Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:5fe923690e056a3b667f66de0dc7cd8d6c5f2d98e15aab12570221e446600a5f","observation_id":"3c40f7ac-7a35-4f5d-ba29-539d8f14ddcd","resolution":{"observed_at":"2026-08-06T19:51:57.053636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:56.828117Z","title":"City-scale landmark identification on mobile devices,","venue":null,"work_id":"fdd1d5c6-c5f9-4783-a433-014038cc388e","year":2011},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.307081Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:dafc7f9974a6a17709c09a609b8d07d750e86d71b03cfa1bbc692864876e5319","observation_id":"6df5821e-0bac-4bdf-86b9-8ac1b311214a","resolution":{"observed_at":"2026-08-06T19:51:56.892027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:56.520979Z","title":"Imagdressing-v1: Cus- tomizable virtual dressing,","venue":null,"work_id":"70e424d1-0789-488d-989a-e0e8f625813c","year":2025},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.394012Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:5e55aee92ad1ba604492a9abbef8873c9666dc87083ab58eca28d1f51868a82f","observation_id":"c13af43b-2b0c-4343-b543-574fb85d132c","resolution":{"observed_at":"2026-08-06T19:51:56.661234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:51.465976Z","title":"Imagpose: A unified conditional framework for pose-guided person generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.465976Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:c5e6d447c5e2f7d1afdfbd2c54e1d441696bb6fd249c9f76d6445f0c2cd471f0","observation_id":"3243608f-e3ab-4310-9934-8b36b0961e8b","resolution":{"observed_at":"2026-08-06T19:51:51.465976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:56.234671Z","title":"Dsac-differentiable ransac for camera localization,","venue":null,"work_id":"5c2ebe1d-f1b6-4482-9ff4-78094bba01ab","year":2017},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.567426Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:1c1ea89102c8bb1605af8cfea4c6472eedb4bdd368e939e0c83ed207ff0b257c","observation_id":"28313878-7355-4dd8-88e7-2d146d3d4dd9","resolution":{"observed_at":"2026-08-06T19:51:56.366071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.994916Z","title":"Hybrid scene compression for visual localization,","venue":null,"work_id":"0985c31a-2f12-4445-8b55-7f5545249c65","year":2019},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.604086Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:eb519f075548494df6860cbc45a4b331f943854a5a71a49c99dcb4ccdb2ba255","observation_id":"eaf78365-3f39-4339-94d2-fb681fe3373e","resolution":{"observed_at":"2026-08-06T19:51:56.099167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.808427Z","title":"Map-free visual relocalization: Metric pose relative to a single image,","venue":null,"work_id":"0ea20fec-8ca7-47da-8f7a-795bb4d766aa","year":2022},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.641587Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:f1fa7fc1c621368efd10b0bdd1b0f39d6c50fcb405729be0964b201a110ef91f","observation_id":"c0b92286-dabf-42d7-a745-590ecbcb0bc2","resolution":{"observed_at":"2026-08-06T19:51:55.912782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.693430Z","title":"Learning multi-scene absolute pose regression with transformers,","venue":null,"work_id":"a199626d-64a5-414b-af65-5d1ce950004f","year":2021},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.742970Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:844eb522a95239dd47587a0e261b7d86095cd0408f933777c3ce2328b75a4441","observation_id":"cec9be87-48db-4302-8628-d1ced13e8a31","resolution":{"observed_at":"2026-08-06T19:51:55.740171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.547036Z","title":"Geometry-aware learning of maps for camera localization,","venue":null,"work_id":"d232bd3b-04f8-48e6-9442-adfb1dc9049f","year":2018},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.798687Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:3c05eb26ead64b917c8b0ceea7cac2f43fcc9aff02a722714bd38271bd4e64e3","observation_id":"cc0e3ccf-ea5f-405f-b71a-94df2dabad27","resolution":{"observed_at":"2026-08-06T19:51:55.618580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.336885Z","title":"Fusionloc: Camera-2d lidar fusion using multi-head self-attention for end-to-end serving robot relocalization,","venue":null,"work_id":"c659e805-fff2-495f-be93-6c501bf1f6f2","year":2023},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.894716Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:2e2d7073a26e6f9cbb20c2f3c8ba81eb88e10266e31ecc48e9fb65f7ca1afbfa","observation_id":"c44a2cfe-b1cc-4474-941d-dcaf2fd101b9","resolution":{"observed_at":"2026-08-06T19:51:55.452563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.187158Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"11edd8df-cb54-4247-9f47-29f4746db9ae","year":2021},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.949874Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:958b9bc6ed6248cfb8c9a60dbfb5a2fdf3ce342150886fae2afd7bc12a78df9c","observation_id":"75f786dc-6c23-417d-8104-ed146e475ff7","resolution":{"observed_at":"2026-08-06T19:51:55.249451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-06T19:51:52.021631Z","title":"Clip-adapter: Better vision-language models with feature adapters,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.021631Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:80786a41578017e75e0731aaec3c71dea1b4cabab37507d52c5b1c4acc1255a3","observation_id":"7b745bcb-5c88-475d-b6fc-c15536b35469","resolution":{"observed_at":"2026-08-06T19:51:52.021631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.024260Z","title":"Envedit: Environment editing for vision-and-language naviga- tion,","venue":null,"work_id":"dedc0d18-0b87-4423-92b1-873bb86005e1","year":2022},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.093706Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:7662b3d49949db5af96d3c10c3c977f9f33716140f7ed0d0b8c538583c6db1e2","observation_id":"e814071b-bf23-4026-8066-692a376fc4c7","resolution":{"observed_at":"2026-08-06T19:51:55.073543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:54.914171Z","title":"Learning to generate scene graph from natural language supervision,","venue":null,"work_id":"4a70ab9e-cf78-4920-8267-28fd2a4c11f4","year":2021},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.204735Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:a267b24703aacd2c7a68fdf348ce9ec162027981b7e704c8b861e594b3ada22e","observation_id":"eb68e5e1-1336-4a25-be70-1f42839c86d7","resolution":{"observed_at":"2026-08-06T19:51:54.966464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:54.796869Z","title":"Denseclip: Language-guided dense prediction with context-aware prompting,","venue":null,"work_id":"ecbd7be4-f7e9-410b-ba55-df5b612944d7","year":2022},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.282022Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:ea665d0ce74e2142da6dbf070295a40d282a4e204e5b2e07339656c0d8ef7fcd","observation_id":"c666e258-ce83-4cdc-87b0-d6f1eb17bad3","resolution":{"observed_at":"2026-08-06T19:51:54.855050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:54.605881Z","title":"Fm-loc: Using foundation models for improved vision-based localization,","venue":null,"work_id":"8353d33a-32f1-42ba-b03e-d2fa407e3aea","year":2023},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.397707Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:ce3650be94393f439e72df9340e7aae84c2f075ff8d6c11fcf8204ee4515d41c","observation_id":"9afee136-979f-4461-ad99-dda00c0805d6","resolution":{"observed_at":"2026-08-06T19:51:54.708146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:54.427235Z","title":"Clip-loc: Multi-modal landmark association for global localization in object-based maps,","venue":null,"work_id":"73a6b17f-cb76-4b88-b335-b13cd1903bb3","year":2024},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.488586Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:a9e11e7170616d2ac71b5de74b27e0e97329f6e6bb3e78db1bef3a716f3aeefd","observation_id":"b37d3e6a-e5fd-4118-b89b-61be37dd36e0","resolution":{"observed_at":"2026-08-06T19:51:54.488600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:54.225486Z","title":"Geollm: Extracting geospatial knowledge from large language models,","venue":null,"work_id":"0559af1f-376e-4503-b588-fbb7a5f1ab79","year":2024},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.561556Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:aff586492019587734e75c0b003cc94b6c4ac1ba44833ed468a2d7abd728dd3b","observation_id":"f1622f84-0953-49c4-8d5a-4610bba884a6","resolution":{"observed_at":"2026-08-06T19:51:54.312406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:54.010350Z","title":"Georeasoner: Geo-localization with reasoning in street views using a large vision-language model,","venue":null,"work_id":"250cf89d-cca3-4289-a1f7-f74032bd8767","year":2024},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.660280Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:3b7bb51d6930e5c26c91ab330da7133df10cba4fb4fabeaa030ea22c849238d2","observation_id":"40438513-e33f-406f-9f44-371719b0664f","resolution":{"observed_at":"2026-08-06T19:51:54.112020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06313","last_updated":"2024-11-21T12:06:59Z","snapshot_observed_at":"2026-08-06T18:58:54.051943Z","submitted_at":"2023-10-10T05:13:17Z","title":"Advancing Pose-Guided Image Synthesis with Progressive Conditional Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06313","snapshot_observed_at":"2026-08-06T19:51:52.756841Z","title":"Advancing pose-guided image synthesis with progressive conditional diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.756841Z"},"links":{"cited_paper":"/paper/2310.06313","citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:51b1dc1ac34e86d289cee42bd0111b016ad45d8592d75ef312a12755bcabcc4d","observation_id":"914a639e-3631-4c88-8f43-7a73f31c2c34","resolution":{"observed_at":"2026-08-06T19:51:52.756841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:53.815931Z","title":"Boosting consistency in story visualization with rich-contextual conditional diffusion models,","venue":null,"work_id":"35369030-3242-4e95-9aef-701512c157fa","year":2025},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.847978Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:5432e9064c36e7ba51da6c244d27b9fb33c2cbd5ad3a9e949da421b5afcb4866","observation_id":"64f9f7c1-362b-477c-a6a6-2db52a0c705f","resolution":{"observed_at":"2026-08-06T19:51:53.933474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:53.637608Z","title":"7-scenes dataset,","venue":null,"work_id":"5f468b4a-29be-4c83-9868-d86b6a069d1e","year":2013},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.928410Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:12bced3e2a50d50a9207a6caba5dfc070a604781ce0f8e62899df44513e16461","observation_id":"2e3092c5-4a38-4a7d-a651-017588757960","resolution":{"observed_at":"2026-08-06T19:51:53.706874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:53.454335Z","title":"Do we really need scene-specific pose encoders?","venue":null,"work_id":"b4c8fb15-2c2d-4783-af72-584879aa5e36","year":2021},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:53.005097Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:ed9547a44f6ad95fdcc4d9d61d6fa77dab866312635ea8d7a2b8175a143b9cb2","observation_id":"cbb96d11-fce4-4cb5-9e62-0dc5cccb8b9c","resolution":{"observed_at":"2026-08-06T19:51:53.521611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:53.264289Z","title":"Image-based localization using hourglass networks,","venue":null,"work_id":"22f316e7-e492-4bab-ab7c-7bc6acec878e","year":2017},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:53.074321Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:e75cfe0d3b399c5d969396d1beecbbb0a90ecb598e1b05b9027600c6fefad2ef","observation_id":"d4c93214-bca1-4038-99db-956f9694ab88","resolution":{"observed_at":"2026-08-06T19:51:53.328502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:43:44.922943Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.04509."}