{"as_of":"2026-08-07T12:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:042addc9319cc282bf2ef64a9312bac41d53e785774a2444b3a1063aef31eceb","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:49:48.230001Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23352/citation-record","integrity":"/paper/2506.23352/integrity","json":"/paper/2506.23352/citation-record.json","paper":"/paper/2506.23352"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.054070Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.054070Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:431fc4f78c0c1bec118094b38f311553ea22d3ca21712a39094c755dae21037f","observation_id":"9a2a456f-48b1-461b-9bab-b5febf5309c0","resolution":{"observed_at":"2026-08-06T21:49:42.054070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:49:42.094181Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.094181Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:371f13eff48adc03578c0f1bcf6e5d24b3ca6fbde5c428c6887b5b9bb4a1f39a","observation_id":"7bba69c6-6d78-4fd5-89d6-9cdd55d2ada1","resolution":{"observed_at":"2026-08-06T21:49:42.094181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.194838Z","title":"Henriques, Andrew Zisserman, and Andrea Vedaldi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.194838Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:af66eb3459674406db35a04732f3b865710828e87da503daf75d8c5920122736","observation_id":"3922716b-968a-46df-9b06-41652b632605","resolution":{"observed_at":"2026-08-06T21:49:42.194838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.256991Z","title":"Blumer, Qingx- uan Chen, and Francis Engelmann","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.256991Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:d8f2ab5218f0af4820fe98b94c0c58c3fe5740d32a4fad39fcb1cf8e6b189238","observation_id":"05a9f140-72af-403e-8111-ef8f7d6c539b","resolution":{"observed_at":"2026-08-06T21:49:42.256991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.392137Z","title":"A persistent spatial semantic representation for high-level natural language instruction execution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.392137Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:e8a2c39d46069e9951c9be2f0fe4ec6ae9c72d2c1c9d2d69a01996b1a789b20a","observation_id":"b093582a-470c-4d28-b589-ce745a4c8e3c","resolution":{"observed_at":"2026-08-06T21:49:42.392137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.499765Z","title":"Prompt-rsvqa: Prompt- ing visual context to a language model for remote sensing visual question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.499765Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:89a976797569508eb9f650c70bd3bba02acacd3490444b5c092af8bf3eb80d7b","observation_id":"71ca8a59-5ff8-47a7-9292-8244e40f89d9","resolution":{"observed_at":"2026-08-06T21:49:42.499765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.634508Z","title":"Scanrefer: 3d object localization in rgb-d scans using natu- ral language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.634508Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:8e7a281a8fcb0f3d014554a38cec2e54d677fa9a0993a6d9e467224046b12ce2","observation_id":"dee5502b-394d-4b8a-9d94-53bcfd086c67","resolution":{"observed_at":"2026-08-06T21:49:42.634508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.745471Z","title":"Panoptic vision-language feature fields","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.745471Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:c3b9715f49bf28819c45e252cec16401c5b957f7eb0ad7a741acecda753cadd8","observation_id":"2d18a5ce-27c7-4499-9d5a-6992720f8660","resolution":{"observed_at":"2026-08-06T21:49:42.745471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.839057Z","title":"Stylecity: Large-scale 3d urban scenes stylization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.839057Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:2846162d79b15a0dca88796d474af4b62c2570cb967f054c86419061a52714a5","observation_id":"e45035e5-1c0c-469c-a16e-8289272ccb08","resolution":{"observed_at":"2026-08-06T21:49:42.839057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.929873Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.929873Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:a4bd542357da8458a4814152af38082c8a343255d857ffa7fd5e6ba72467c85b","observation_id":"d71297e6-2235-430c-96e6-bf273376ff1e","resolution":{"observed_at":"2026-08-06T21:49:42.929873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.012679Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.012679Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:52cc3a3b111d716ff1bb186d09043bc2a41635ec1f8dd29aae70803d800948a7","observation_id":"00fe7b97-3e74-4516-ab3c-9da16c510e9c","resolution":{"observed_at":"2026-08-06T21:49:43.012679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15393","last_updated":"2023-10-28T06:56:32Z","snapshot_observed_at":"2026-08-05T22:24:58.767708Z","submitted_at":"2023-05-24T17:56:16Z","title":"LayoutGPT: Compositional Visual Planning and Generation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15393","snapshot_observed_at":"2026-08-06T21:49:43.132312Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.132312Z"},"links":{"cited_paper":"/paper/2305.15393","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:8f6e554b00dffae344e6bab6b7aaf8dca1d8c526ee5d4ed03a0ed4fa7da48cfc","observation_id":"da1aa099-20a3-46e0-a396-41eb294e5e9e","resolution":{"observed_at":"2026-08-06T21:49:43.132312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.190261Z","title":"Dynamic 3d gaussian fields for urban areas","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.190261Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:c6be442cb11f4a48afb3f109e476b030b92901b744564a63a7f5aa684172ef3d","observation_id":"1999571b-cd9a-407c-bc5f-ccfc1b13af7e","resolution":{"observed_at":"2026-08-06T21:49:43.190261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.253760Z","title":"Ue4-nerf:neural radiance field for real-time rendering of large-scale scene","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.253760Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:b6c79c60b579ae0934a8db740db15eb95e14cc387e5eddbcfc03ecca34e17010","observation_id":"70eb2b3b-63eb-4257-a5a6-a8e64cbdd79a","resolution":{"observed_at":"2026-08-06T21:49:43.253760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04988","last_updated":"2023-06-08T07:19:27Z","snapshot_observed_at":"2026-07-06T15:40:08.685976Z","submitted_at":"2023-06-08T07:19:27Z","title":"StreetSurf: Extending Multi-view Implicit Surface Reconstruction to Street Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04988","snapshot_observed_at":"2026-08-06T21:49:43.307473Z","title":"Streetsurf: Extending multi-view im- plicit surface reconstruction to street views","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.307473Z"},"links":{"cited_paper":"/paper/2306.04988","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:646d19bf07a33926b53579f8b9c9cdb29403c9751f48995780f1f497223ab111","observation_id":"a5fa8581-1343-47b9-8e7c-a86977f9e80d","resolution":{"observed_at":"2026-08-06T21:49:43.307473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.378479Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.378479Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:9434ba27f923703577a5e0ddb347c5b3d9b71e1547457419527ce6f2d3f6a1d3","observation_id":"36a3ba48-3582-43fb-8f84-603d4d76c0a2","resolution":{"observed_at":"2026-08-06T21:49:43.378479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.437098Z","title":"Pigeon: Predicting image geolocations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.437098Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:7f51727a2b162d9cf85b00e2ffcd33c498458ce9e583723eedee206fa40237d0","observation_id":"15cf77ae-37cc-48a1-9156-f7661f6bd688","resolution":{"observed_at":"2026-08-06T21:49:43.437098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.490242Z","title":"Dragon: Drone and ground gaussian splatting for 3d building reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.490242Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:ff16587f8a0cda66b72c09cd11eebc1e105c6e022591324efaae2adfa81dad9a","observation_id":"a4e7e80a-1a68-44a6-a34d-90d8b1bbb3b8","resolution":{"observed_at":"2026-08-06T21:49:43.490242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.533958Z","title":"3d-llm: Inject- ing the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.533958Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:aea3bdeffa2c1064dff6d94afe1d9e47f8123e5202ed375c8e81a705d8fd7a68","observation_id":"eb5e3a97-aac3-425d-a4cc-cc6dec241d00","resolution":{"observed_at":"2026-08-06T21:49:43.533958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15266","last_updated":"2023-07-28T02:23:35Z","snapshot_observed_at":"2026-08-05T09:46:05.780158Z","submitted_at":"2023-07-28T02:23:35Z","title":"RSGPT: A Remote Sensing Vision Language Model and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15266","snapshot_observed_at":"2026-08-06T21:49:43.574175Z","title":"Rsgpt: A remote sensing vision language model and benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.574175Z"},"links":{"cited_paper":"/paper/2307.15266","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:40002c060a445209a0bbf54ce463576769645a27bcf558dff088066db3534c0f","observation_id":"3edb0cda-0e2e-45c5-b5c1-bc48b5709486","resolution":{"observed_at":"2026-08-06T21:49:43.574175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06234","last_updated":"2025-01-27T01:45:15Z","snapshot_observed_at":"2026-07-06T19:29:55.838200Z","submitted_at":"2024-10-08T17:45:51Z","title":"TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06234","snapshot_observed_at":"2026-08-06T21:49:43.614807Z","title":"Teochat: A large vision-language as- sistant for temporal earth observation data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.614807Z"},"links":{"cited_paper":"/paper/2410.06234","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:42a2a0501dc67b3031e2abde0026960f1ddeddde12581176111e6ff0b6c976a1","observation_id":"57381278-8928-4fa2-bd2c-0c0df261d55d","resolution":{"observed_at":"2026-08-06T21:49:43.614807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02084","last_updated":"2024-09-03T17:35:48Z","snapshot_observed_at":"2026-08-03T21:07:30.308924Z","submitted_at":"2024-09-03T17:35:48Z","title":"GraspSplats: Efficient Manipulation with 3D Feature Splatting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02084","snapshot_observed_at":"2026-08-06T21:49:43.660608Z","title":"Graspsplats: Efficient manipulation with 3d feature splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.660608Z"},"links":{"cited_paper":"/paper/2409.02084","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:08e125ccff9068fc27c712fcdd03d9f526a5ca0518db90f73f070af8788d6add","observation_id":"cacaa869-fdd5-498b-aa6c-f7c052d768b2","resolution":{"observed_at":"2026-08-06T21:49:43.660608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:50:00.128731Z","title":"Fastlgs: Speeding up lan- guage embedded gaussians with feature grid mapping","venue":null,"work_id":"ba415ffc-2259-4ee3-9b3c-8e7d69d08812","year":2025},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.729855Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:7e65a57f285448251e311d964abc9c514f26cb6417c103dd5a17a4c00fe8271f","observation_id":"da349638-f488-43c6-9293-b7e9a72dbcaa","resolution":{"observed_at":"2026-08-06T21:50:00.199756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.962023Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"deee3d88-cb9b-40cb-b095-0b6186afa91f","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.778265Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:182ac77d375b1d7fc4fbe03a338c2872bb5c0306597a7c730b318861d41caac5","observation_id":"4cc0bab2-8de2-4525-a191-6972b1f1a3ef","resolution":{"observed_at":"2026-08-06T21:50:00.069090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.798227Z","title":"A hierarchical 3d gaussian representation for real-time ren- dering of very large datasets.ACM Transactions on Graphics (TOG), 43(4), 2024","venue":null,"work_id":"aeed35e0-b4ee-4b08-8fc1-ff55b3024df2","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.817893Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:b2bd4a53bafb4b7da11284512ad090f0ebd173bc65f1e8c4312b78d2c18c6b25","observation_id":"5079a02f-46e7-4f71-96b1-0ae8264c004f","resolution":{"observed_at":"2026-08-06T21:49:59.894873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.662944Z","title":"LERF: Language embed- ded radiance fields","venue":null,"work_id":"4aacd5f3-d29d-41bf-a8be-205fb9834e16","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.885600Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:459e5f88fd84e51f9706bd2c12aebe48590a19714293aebc4612fcafaaf79701","observation_id":"f03dc12f-8688-4d4f-b78a-3b4d89abee4c","resolution":{"observed_at":"2026-08-06T21:49:59.718873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.518442Z","title":"Lobell, and Ste- fano Ermon","venue":null,"work_id":"720917b2-6955-44af-8703-bb63f0527230","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.952849Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:523961a5bf61be1d73fd6c35ef1ec2528ff09abbf91dace8459fe9105eaa1e0f","observation_id":"4d690336-278a-482b-b22a-6b0373ac9ea7","resolution":{"observed_at":"2026-08-06T21:49:59.590614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.409360Z","title":"Berg, Wan-Yen Lo, Piotr Dollar, and Ross Girshick","venue":null,"work_id":"76e25007-73d8-4ab0-83a5-4b991f292c27","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.000320Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:ac06fe51216920dc834301d7e7803c79f2ce33091b8662f9c7e280624415173b","observation_id":"77bafc28-a913-4c26-8aad-80d6f1db3910","resolution":{"observed_at":"2026-08-06T21:49:59.476659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.222961Z","title":"Segment any- thing","venue":null,"work_id":"d1b05c2d-b2a3-46c0-82a0-dc917a9f526d","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.042944Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:a409c62a9ac64280e204adc00835fc5684689b91bbc78415925111c949ea31d3","observation_id":"512e23fd-0770-4804-8f56-d514e6f22f0c","resolution":{"observed_at":"2026-08-06T21:49:59.303634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17179","last_updated":"2024-04-12T22:23:32Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T19:14:40Z","title":"SatCLIP: Global, General-Purpose Location Embeddings with Satellite Imagery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17179","snapshot_observed_at":"2026-08-06T21:49:44.101737Z","title":"Satclip: Global, general- purpose location embeddings with satellite imagery","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.101737Z"},"links":{"cited_paper":"/paper/2311.17179","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:a1796df6a249417e5a21e54d0598dd6a26514468b08991f56888163a0b7446c5","observation_id":"383964ea-5fb3-40a4-b019-7b71dbe8a3ed","resolution":{"observed_at":"2026-08-06T21:49:44.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.118264Z","title":"Decomposing nerf for editing via feature field dis- tillation","venue":null,"work_id":"0d6bec61-5f78-409b-b573-091c82be843e","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.136124Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:1c51703aaae2297305d759c8062bce4a6fdfef495e64896f5edcc20dddfccb22","observation_id":"db4b74fd-35ac-4f0d-96c4-308024254d38","resolution":{"observed_at":"2026-08-06T21:49:59.166663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.998301Z","title":"Text2pos: Text-to-point-cloud cross-modal localiza- tion","venue":null,"work_id":"e81e781d-ad5f-4303-951b-8d976db2564e","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.170793Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:aa260fb717e28b17048f60b758d0adfde7e0d1565c3775008d09681fb7ba3284","observation_id":"4594861b-9cfa-4255-9ca0-32b88981eb59","resolution":{"observed_at":"2026-08-06T21:49:59.064991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.856739Z","title":"Geochat: Grounded large vision-language model for remote sensing","venue":null,"work_id":"d610beba-cab7-4299-8439-10f6ebf3c3e4","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.222774Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:3782287401129b2ac493398ba125e6023b25b21097210dad6cd912ff42bd5552","observation_id":"8eb4957f-fbb9-41b1-8285-94555bb82c3d","resolution":{"observed_at":"2026-08-06T21:49:58.903803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.678476Z","title":"NeRF-XL: Scaling nerfs with multiple GPUs","venue":null,"work_id":"77498d10-3464-46b6-82cd-4fe51f3ef17f","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.267005Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:7eac1884dd2565e291046a48d333b68c9c854de268e90b782fcbdef14eae3589","observation_id":"7b1fd120-5535-440d-8b72-83d94a97fa55","resolution":{"observed_at":"2026-08-06T21:49:58.773105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.546718Z","title":"Matrixcity: A large-scale city dataset for city-scale neural rendering and beyond","venue":null,"work_id":"6dd4f624-7cb3-4b4a-9158-31516384908b","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.309914Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:51203bbb285554da16e57b93405b3a22ccfda4cbfb7a65c8f76492ed7b3c305d","observation_id":"51b0f3b3-7f83-4852-bc1d-694b87713b73","resolution":{"observed_at":"2026-08-06T21:49:58.613797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.398190Z","title":"Vastgaussian: Vast 3d gaus- sians for large scene reconstruction","venue":null,"work_id":"6ded315b-5af7-4cda-a20c-62a14ce08eca","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.345633Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:7acdca1ef4a2128f16906fbf930d95af7c3d9afda7a58f252b62d2bf4127d5c7","observation_id":"a5a46439-664f-40d8-a915-3f451efd8976","resolution":{"observed_at":"2026-08-06T21:49:58.486658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.289614Z","title":"Capturing, reconstructing, and simulating: the urbanscene3d dataset","venue":null,"work_id":"0eeb2eaf-ed52-47e4-ba05-bac0639d392d","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.377705Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:bd28d7ae6e87349bd0dcde247ddf0d4f473d6b11d0fb6ac5c50f229c98f17ead","observation_id":"11471b57-9a6a-442e-adb6-c54a6d7a3237","resolution":{"observed_at":"2026-08-06T21:49:58.345746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.139130Z","title":"Re- moteclip: A vision language foundation model for remote sensing","venue":null,"work_id":"5ac34351-2805-4df3-aa19-df2048a6f80c","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.441781Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:6de29b0d2823cb68958e8285844515facdb2ea9cc9cb7b5a99c4d53e008b37a1","observation_id":"2ffa59ba-1675-421a-89c6-c32d5bd75650","resolution":{"observed_at":"2026-08-06T21:49:58.217038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.018530Z","title":"Visual instruction tuning","venue":null,"work_id":"9af0550d-a2d3-44d2-a8a5-2167f9659ba3","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.492129Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:b71906242868d014c4900e2eb340c33fa96cfa5ab839046f03f1654b8e141f84","observation_id":"321362df-eaa4-42f8-ad62-66f8dfe04287","resolution":{"observed_at":"2026-08-06T21:49:58.049953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:57.838249Z","title":"Citygaus- sian: Real-time high-quality large-scale scene rendering with gaussians","venue":null,"work_id":"7c546017-0758-4a1d-9f12-5bb92390ebbe","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.536960Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:f9437c28d892c500caa9c33365e1136ce65459ba9153dfa6f851f711f20d0eba","observation_id":"7da5c1eb-1eb3-48c3-abb9-73bcdc066f97","resolution":{"observed_at":"2026-08-06T21:49:57.943733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:57.598933Z","title":"Citygaussianv2: Efficient and geometri- cally accurate reconstruction for large-scale scenes, 2024","venue":null,"work_id":"cbfbe8a7-10f7-40e7-a125-cde61db66640","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.579863Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:081c422dd1b8dc37df00fadbcafe40f10186ea4f90d8d4ccbaf07309baa6af94","observation_id":"c5b516e5-64a8-4bbc-9865-6fbfc9fb13b8","resolution":{"observed_at":"2026-08-06T21:49:57.732635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:57.399057Z","title":"Citygaussianv2: Efficient and geometri- cally accurate reconstruction for large-scale scenes","venue":null,"work_id":"971357b0-a899-4d1f-823d-0ef119ea327f","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.633032Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:77f5e68ddb1078685fba1c71808f0fee043049a2e1f761c4c99a87a046e4fcc7","observation_id":"64464ef6-4f58-491e-a64e-c1aea177f006","resolution":{"observed_at":"2026-08-06T21:49:57.486653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:57.263263Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models","venue":null,"work_id":"6fd05dd3-b3f5-4671-be12-cf4e0707b91f","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.673401Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:39486e049939304330eb5ab250b6638e886bfdb362ee53128e8f31ad7dc2c9d7","observation_id":"a39d028d-c282-40a8-841b-91b5017f9523","resolution":{"observed_at":"2026-08-06T21:49:57.326550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:57.066101Z","title":"Exploring models and data for remote sensing im- age caption generation","venue":null,"work_id":"fc4c9269-38b9-47e1-8980-2ba8f755daa7","year":2018},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.722564Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:433f903f1cb66428108290e73646ac820f576dbc9422e4326cb46860b6129eb9","observation_id":"411a2e79-1115-4057-b457-d2753476d1ce","resolution":{"observed_at":"2026-08-06T21:49:57.153451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-07-06T18:31:04.425917Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-06T21:49:44.779870Z","title":"Skysensegpt: A fine-grained instruction tuning dataset and model for re- mote sensing vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.779870Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:210a4a63d2af877260cd3fc2633de1c8dd0fea30c6e085ae1003c0fadc280d4b","observation_id":"42f8f1c8-c23b-4d8e-bec0-fae4bce9c14e","resolution":{"observed_at":"2026-08-06T21:49:44.779870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:56.932171Z","title":"A multiscale grouping transformer with clip latents for re- mote sensing image captioning","venue":null,"work_id":"b97b128d-9035-458d-9dc0-e4fd859a1a5e","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.839366Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:4691aae2fe825aaf98c2de345bbc3154386b27a0b7fefaf8cf73e443f2c89deb","observation_id":"1c23294a-ff1c-43ac-9251-0d118650d631","resolution":{"observed_at":"2026-08-06T21:49:56.999396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:56.776358Z","title":"Llama 3.2 connect 2024: Vision on the edge and mo- bile devices","venue":null,"work_id":"ad9870e1-4220-4e9e-a730-04d2057f97ac","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.886549Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:cb8b93119aef4de3c8f080b2fd4a94f2ca0b5d057821fc2294658be6b869efcd","observation_id":"8692614f-bbd4-425f-b298-23576a5f2c93","resolution":{"observed_at":"2026-08-06T21:49:56.865133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:56.570653Z","title":"Srinivasan, Matthew Tancik, Jonathan T","venue":null,"work_id":"0efd939f-fc25-40f0-8c32-ba9b5e044308","year":2020},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.962424Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:15961173d4f12b09d6a14cdcdde1f3fe09891651d5665da2db882d0286644201","observation_id":"968bc7a2-0782-4099-b787-0fc6d70410f8","resolution":{"observed_at":"2026-08-06T21:49:56.632184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:56.456814Z","title":"Cityrefer: Geography-aware 3d visual grounding dataset on city-scale point cloud data","venue":null,"work_id":"94e2f7ea-1c6a-4085-9d5b-c48c6e818346","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.026632Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:2ea221dc1bf05f5d5f721b3605a3807bf4f4d563176850490b3457dea1be98a3","observation_id":"dadfd791-b5fc-4459-a5cf-e26c4aa29d90","resolution":{"observed_at":"2026-08-06T21:49:56.486953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:56.309526Z","title":"Lhrs-bot: Empowering remote sensing with vgi-enhanced large multimodal language model","venue":null,"work_id":"a7889c98-bb8e-4e92-b91c-6e6f15a0ba37","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.078369Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:382b4968e8c28322bc6674505f98572c6b6555af2dd171ea312ceb0235c77f89","observation_id":"c84971c3-8ab1-4f8c-98e6-f143ba7b7feb","resolution":{"observed_at":"2026-08-06T21:49:56.346668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:56.177745Z","title":"Hello gpt-4o","venue":null,"work_id":"eec27654-29cd-48eb-908c-2d1c7ba1adb8","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.171325Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:583335a82bc592f106aa94e8ce27ed5db099f549361c8773253a88e9a8ccd512","observation_id":"a6f53a50-2fbb-4fa8-9bb5-82087eb5ffff","resolution":{"observed_at":"2026-08-06T21:49:56.242315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.981342Z","title":"Vhm: Versatile and honest vision lan- guage model for remote sensing image analysis","venue":null,"work_id":"7327660b-84ff-49b1-a495-bee4c78c56b1","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.242656Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:a4942c5e25c279b45993e5b7ea7a6fd2e9c8139a3fccc3cf06b37e99ccf2f016","observation_id":"a7d2eac8-8edb-49c0-9d47-9a7287cd4e45","resolution":{"observed_at":"2026-08-06T21:49:56.086960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.806437Z","title":"Langsplat: 3d language gaussian splatting","venue":null,"work_id":"0fa7187c-fb56-4529-a76f-78ef09ff7e34","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.317392Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:8804f88de7bc303fdb51b448b59241d2b8a0cf3fd2b82f476a0b52762dc24df9","observation_id":"ede4e48d-4a1f-44e3-8d07-8c976f4a375d","resolution":{"observed_at":"2026-08-06T21:49:55.894524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.645989Z","title":"Deep semantic understanding of high resolution remote sensing image","venue":null,"work_id":"05a4f757-4c0d-46ef-9f6d-e588dd10596c","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.454471Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:192fef0c555dbc736f47c654ee198939960e18db97d193441aca5380e2a9e19f","observation_id":"597031c2-4287-4768-9ec9-9c81916f7abe","resolution":{"observed_at":"2026-08-06T21:49:55.736156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.533691Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"f9b12d89-29da-48aa-9df1-5bf46e41d808","year":2021},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.537922Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:729b89240d0d0d8bd368229d3aa5e5c3ea93d39bf5971a8fffdaed03760d2cec","observation_id":"c47a1362-4105-4afd-b80a-93a9f0db17c5","resolution":{"observed_at":"2026-08-06T21:49:55.596461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.317267Z","title":"Derf: Decom- posed radiance fields","venue":null,"work_id":"99a791d9-fd7f-4071-9ba4-1561a9c0f43d","year":2020},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.650119Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:e5b2cb928b96dcec1ce56c1e74cb9f78c34a9c566dfa921e0e055022bd04e2e0","observation_id":"12ebebed-4dce-4e81-9e20-ce61af8ba3db","resolution":{"observed_at":"2026-08-06T21:49:55.445680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.162380Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":"938c2f18-5778-4b6f-a2b1-39c2992acbe1","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.703626Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:2e74aa177fe6326175820b0b8cf77e7c987513a0439e4f560f5aa895bd456997","observation_id":"72561cb0-d64b-4d2e-9e0d-559e86cabb15","resolution":{"observed_at":"2026-08-06T21:49:55.249562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05663","last_updated":"2023-05-22T22:34:29Z","snapshot_observed_at":"2026-08-06T13:49:39.474018Z","submitted_at":"2022-10-11T17:57:10Z","title":"CLIP-Fields: Weakly Supervised Semantic Fields for Robotic Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05663","snapshot_observed_at":"2026-08-06T21:49:45.758919Z","title":"Clip-fields: Weakly supervised semantic fields for robotic memory","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.758919Z"},"links":{"cited_paper":"/paper/2210.05663","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:9dc1757ca3c6d223042c76f9e088fe702f9db7715a23eb20783a336da7072435","observation_id":"c64e465f-305b-429a-8906-0612a0ab092e","resolution":{"observed_at":"2026-08-06T21:49:45.758919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.020880Z","title":"Language embedded 3d gaussians for open- vocabulary scene understanding","venue":null,"work_id":"9935f64b-83ce-4c13-a9d0-d095b6691f47","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.808762Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:3230765d4e85a186a21a0bb1a1f663dcc72353df8f3eb73e16037d3c1716002b","observation_id":"1cca6068-bdbe-4e95-b372-49d2d1cc4e29","resolution":{"observed_at":"2026-08-06T21:49:55.086891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:54.907734Z","title":"Real-time view synthesis for large scenes with millions of square meters","venue":null,"work_id":"6d4e2e3d-aa26-4ccd-b62d-f96c556614ba","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.867334Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:d5ced86ea159cd42d99ec99b28cfe06c3c3974a1feab59ad6527a53e434902fa","observation_id":"753f4515-7c61-4625-8f72-df9435fd83cc","resolution":{"observed_at":"2026-08-06T21:49:54.947992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:54.705630Z","title":"City-on-web: Real-time neural rendering of large- scale scenes on the web","venue":null,"work_id":"6688e07f-5614-4be2-8092-fd22a9915c07","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.905136Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:13d959502d11ad1cdf65e85189b1fee9e9f3f8dfb369e122ebbb6960bf37d721","observation_id":"86280683-e13f-4125-a85d-f36cb77c5652","resolution":{"observed_at":"2026-08-06T21:49:54.815656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:54.524563Z","title":"De- composing 3d scenes into objects via unsupervised volume segmentation","venue":null,"work_id":"3cb39655-9c48-4bbc-9a39-4bb95535a9fb","year":2021},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.023299Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:643f1508e708066b187d9ed9735913803a1d792fea437b7082fb98062c89bc9e","observation_id":"b9c0206e-f8e7-4604-82a5-16898e815aeb","resolution":{"observed_at":"2026-08-06T21:49:54.633027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:54.368604Z","title":"Modular visual question answering via code generation","venue":null,"work_id":"b2d66fe5-be18-4b04-b5e7-c5f4e50d9b7f","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.069829Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:2d3a5365c62886fe6264e1830a8636a393681b98a895da8c2ce04943c16890f8","observation_id":"700651a4-cb5f-4101-b462-ca96833df9cb","resolution":{"observed_at":"2026-08-06T21:49:54.454110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:54.226134Z","title":"3d ques- tion answering for city scene understanding","venue":null,"work_id":"9409d382-50cb-46fb-b999-df04c0030c47","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.122863Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:c9af10c14360e0b06ceace4be9579ce0574a132c9167b5f2cf2b0fedc9b705dc","observation_id":"dc431695-f1e0-4f6f-a2d7-2bbbf9863b43","resolution":{"observed_at":"2026-08-06T21:49:54.292203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:54.154381Z","title":"Visual grounding in remote sensing images","venue":null,"work_id":"3e543165-daed-4f44-9d81-8c595b2853b9","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.179689Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:86514e09850e10b03c0cbbee43f0f2280e961495321b6581b3cb56c3f79e5c27","observation_id":"a116152e-ee2d-47bc-a708-0b273c10d0b5","resolution":{"observed_at":"2026-08-06T21:49:54.192127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:53.967287Z","title":"ViperGPT: Visual inference via python execution for reasoning","venue":null,"work_id":"2a253cfa-0193-494c-a9b4-5526044ab1a4","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.235926Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:e8bd70541cc4533ea4da8b6a02f2b8317f0330805ba3e65a75df7458b9fa59e0","observation_id":"89523449-652f-4b7d-93aa-f2de235e1a3b","resolution":{"observed_at":"2026-08-06T21:49:54.059622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:53.819118Z","title":"Srinivasan, Jonathan T","venue":null,"work_id":"8e5397e2-4b89-4dd4-ba49-2e0ba11f9329","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.293702Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:6e4573aad2b7cdf877e2e6355b044b8a7b8cbdb53df17da805f86a537d7585e4","observation_id":"d3fd2ac5-28eb-43fd-947f-dc05078d97f3","resolution":{"observed_at":"2026-08-06T21:49:53.881502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:53.680540Z","title":"Crs-diff: Controllable generative re- mote sensing foundation model","venue":null,"work_id":"eef328a6-0f86-4719-801b-1991ab76e3ce","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.366132Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:7c886ea63e3b060540bf0f87f104fb28610d6c7fbbe5766adeefd06724fccf49","observation_id":"57e570d9-5479-4183-9948-0f315a385603","resolution":{"observed_at":"2026-08-06T21:49:53.729228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01413","last_updated":"2024-05-02T16:04:30Z","snapshot_observed_at":"2026-07-06T18:08:52.053005Z","submitted_at":"2024-05-02T16:04:30Z","title":"MiniGPT-3D: Efficiently Aligning 3D Point Clouds with Large Language Models using 2D Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01413","snapshot_observed_at":"2026-08-06T21:49:46.416409Z","title":"Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.416409Z"},"links":{"cited_paper":"/paper/2405.01413","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:f1cf82e0a5f8a2ccdb35fd386182a40d554b2fe23da77ee83c2e48cf607f9f84","observation_id":"e963ca73-2e31-42fd-b422-939edfc5e32f","resolution":{"observed_at":"2026-08-06T21:49:46.416409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:53.564637Z","title":"Mega-nerf: Scalable construction of large-scale nerfs for virtual fly-throughs","venue":null,"work_id":"3b06f302-793e-4747-837f-9a701d0f55d5","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.462758Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:9e9e82d3c25b1cf8f1ff359b7c2d16b131c6824d0d9ac201696ed2aa8f68a589","observation_id":"43ac9ec0-b7ff-427a-a3de-96a9fb84d01e","resolution":{"observed_at":"2026-08-06T21:49:53.611663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:53.412250Z","title":"Geoclip: Clip-inspired alignment between locations and im- ages for effective worldwide geo-localization","venue":null,"work_id":"66b543ee-d2a4-43ae-8be7-fa221e43afa3","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.542012Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:96d14b67856cd28c0b72165f0703bff674a5827e179dc450bed851476b64b058","observation_id":"66328b1d-9627-491e-b845-e8701b4ae3d7","resolution":{"observed_at":"2026-08-06T21:49:53.524417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:53.119014Z","title":"Skyscript: A large and semanti- cally diverse vision-language dataset for remote sensing","venue":null,"work_id":"cb731437-b28b-4d2e-b5b5-b7ce93082f8c","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.608758Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:23f741a65270a82ec9c15f14adad41bfcabd7b2be31dbc82223aa0164905a870","observation_id":"08dcae4e-331b-4fde-a88e-c931cd680623","resolution":{"observed_at":"2026-08-06T21:49:53.281261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:52.908853Z","title":"Text2loc: 3d point cloud localization from natural language","venue":null,"work_id":"aa55bf91-5e41-4f81-82e9-0e5a6bee761d","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.661207Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:3598e78e2c1063399426cc4647497fc4be1d61252f6f4fb9c7f9e0b9e3f019b4","observation_id":"96d58b29-89ee-43af-b61c-3fb6d54e869a","resolution":{"observed_at":"2026-08-06T21:49:52.994039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:52.616020Z","title":"Bungeenerf: Progressive neural radiance field for extreme multi-scale scene rendering","venue":null,"work_id":"2d0e2a62-6e00-43cc-998c-b5f57bf54b79","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.717819Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:270f54349c9d58445f791ce1153ca3b3fed86c1fc8ad01e41ff052fa2524a63b","observation_id":"e6fdab54-f947-4033-8866-5f2f7e532a5c","resolution":{"observed_at":"2026-08-06T21:49:52.782372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:52.329368Z","title":"Citydreamer: Compositional generative model of unbounded 3D cities","venue":null,"work_id":"168f350f-7d96-45ff-b72d-7db237d2f743","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.764874Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:b542dda4500e1cb3c5ce64efedb96f8a450cb93e30383595a214b299a16cd1cc","observation_id":"74ea19dd-d55c-4610-96da-75d4db71c88a","resolution":{"observed_at":"2026-08-06T21:49:52.490533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06526","last_updated":"2025-02-27T05:39:54Z","snapshot_observed_at":"2026-07-06T18:28:20.634381Z","submitted_at":"2024-06-10T17:59:55Z","title":"Generative Gaussian Splatting for Unbounded 3D City Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06526","snapshot_observed_at":"2026-08-06T21:49:46.818968Z","title":"GaussianCity: Generative gaussian splatting for unbounded 3D city generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.818968Z"},"links":{"cited_paper":"/paper/2406.06526","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:0eb7459f5ade7c2beda9051159c177bda9aa9aa87466141a34dc71a90fb33768","observation_id":"7cb1dfe4-9caa-4660-8e0f-322ee862b86d","resolution":{"observed_at":"2026-08-06T21:49:46.818968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:52.004317Z","title":"Grid-guided neural radiance fields for large urban scenes","venue":null,"work_id":"56e91b69-6e1b-407b-9f0f-55df67564c31","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.895366Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:a732984200252e31f08ec52a7646e41fc7f24f6bbdf9efc349f48acaceca58c5","observation_id":"8ad4195c-3cd5-4c51-9efb-b631cd4f3f37","resolution":{"observed_at":"2026-08-06T21:49:52.184167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:51.767269Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":"05ec943f-e3e5-4bf6-a1fb-a8e47b951ae8","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.938093Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:2673e3ab289afb765b5d89ddafd6f4fccbee331b41ce5307c99fe64b9b41bb15","observation_id":"b760559c-52cb-4306-a908-3e67e5e05eeb","resolution":{"observed_at":"2026-08-06T21:49:51.883576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:51.531490Z","title":"Addressclip: Empowering vision-language models for city-wide image address localization","venue":null,"work_id":"dda4836a-4536-4f13-ab94-453825b03d77","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.105618Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:4aeefc6ce0b1feb0109867e67a4c0671e0fc9e2d1fc9d222c5f1ce73787c1dc9","observation_id":"e3dd9d04-2419-4c03-a6a6-a96cfc73e4c1","resolution":{"observed_at":"2026-08-06T21:49:51.674509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:51.329008Z","title":"Unisim: A neural closed-loop sensor simulator","venue":null,"work_id":"20c01311-1638-4555-8c51-ffff14bc396f","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.217718Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:a0be1620083879365fc3d89a8b2795acc05215f7c12b9caaac3f55de4313f1e2","observation_id":"c5b83c66-8f0f-4dff-983b-606d80e0b1ee","resolution":{"observed_at":"2026-08-06T21:49:51.420687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:51.035121Z","title":"Scannet++: A high-fidelity dataset of 3d indoor scenes","venue":null,"work_id":"772c8132-2d54-453f-b30d-a7ff79c41073","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.345334Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:c55d1b6c068b8ac6ae6742ff98b31d49932699872b825d40989bb141ca20fa71","observation_id":"8a8f6348-3a1f-4b59-8b62-811d51aae34f","resolution":{"observed_at":"2026-08-06T21:49:51.161037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:50.817913Z","title":"Dogs: Distributed-oriented gaus- sian splatting for large-scale 3d reconstruction via gaussian consensus","venue":null,"work_id":"108cbcbe-b01f-46f1-adfd-a496230d7a2e","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.442586Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:f43df44b3d10b36abeacaf2ed8594283aef3f71b75a6103e3660737cab49d8a1","observation_id":"928e6764-3973-4ad1-bf7b-d15f99d7e2e9","resolution":{"observed_at":"2026-08-06T21:49:50.891902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09079","last_updated":"2024-07-15T02:18:09Z","snapshot_observed_at":"2026-07-06T17:44:21.659847Z","submitted_at":"2024-03-14T03:52:33Z","title":"PreSight: Enhancing Autonomous Vehicle Perception with City-Scale NeRF Priors","version":3},"cited_work":{"arxiv_id":"2403.09079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09079","snapshot_observed_at":"2026-08-06T21:49:48.477693Z","title":"PreSight: Enhancing Autonomous Vehicle Perception with City-Scale NeRF Priors","venue":"cs.CV","work_id":"6c0c2b10-0ec6-4bdd-8e5a-7b782371b5a5","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.509275Z"},"links":{"cited_paper":"/paper/2403.09079","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:4b475b16bf13c76fba67e3e5f6d20be0bb9101ac8af20d761a2a131e2097f79f","observation_id":"c06fb373-00e8-4647-aca5-bfeb0b7331a2","resolution":{"observed_at":"2026-08-06T21:49:48.524762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:50.643978Z","title":"Exploring a fine-grained multiscale method for cross-modal remote sensing image re- trieval","venue":null,"work_id":"39dac2e7-4a5f-464e-9ec8-1a5eeb85fdd6","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.551158Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:dd7425bab6d954be49e0cda8a5c4b5d4d844d5ba3afc0126fc3a7a0b748117bf","observation_id":"07bb5d59-1330-4260-90f3-f1ce37af3872","resolution":{"observed_at":"2026-08-06T21:49:50.727057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:50.343338Z","title":"Garfield++: Reinforced gaussian ra- diance fields for large-scale 3d scene reconstruction, 2024","venue":null,"work_id":"75573877-f65e-4d87-8c98-a598feaa0e88","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.607078Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:98d2d9e5da63cc923033a44a9abc4ca09475c5313016a232e6bd6437d85da960","observation_id":"c8b06b90-3f35-40f9-bfbd-76a741394e33","resolution":{"observed_at":"2026-08-06T21:49:50.489234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:50.111234Z","title":"3DitScene: Editing any scene via language-guided disentan- gled gaussian splatting","venue":null,"work_id":"d8613150-87fa-4baf-87ab-ddace664206b","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.663922Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:f050be88e9b40f01020f1c9526bcaaa9e1028edab92581ff442e08a40c70aa73","observation_id":"1444202d-ec7b-4a38-9b77-da8efe02732a","resolution":{"observed_at":"2026-08-06T21:49:50.181200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:49.910887Z","title":"Earthgpt: A universal multi-modal large lan- guage model for multi-sensor image comprehension in re- mote sensing domain","venue":null,"work_id":"95ef4a41-7237-450a-a131-17c148575dae","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.719996Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:099d532a3db9e7f103d903dbac8cf6ccdea59c8dd55cdeba77f0783bddbf612e","observation_id":"5d435d0e-5c3e-4e41-bda2-42231a60e7fa","resolution":{"observed_at":"2026-08-06T21:49:49.989182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13596","last_updated":"2024-11-29T10:18:58Z","snapshot_observed_at":"2026-07-06T18:48:33.555151Z","submitted_at":"2024-07-18T15:35:00Z","title":"EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13596","snapshot_observed_at":"2026-08-06T21:49:47.792628Z","title":"Earthmarker: A visual prompt learning frame- work for region-level and point-level remote sensing imagery comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.792628Z"},"links":{"cited_paper":"/paper/2407.13596","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:311580c6f504f18798f554eae75b4233413d3a39b5a258499672a858a7835cf1","observation_id":"cb0f6bdb-ae78-497e-8085-d4022ea2b322","resolution":{"observed_at":"2026-08-06T21:49:47.792628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03003","last_updated":"2023-03-07T14:46:21Z","snapshot_observed_at":"2026-08-06T19:59:55.051274Z","submitted_at":"2023-03-06T10:04:50Z","title":"Efficient Large-scale Scene Representation with a Hybrid of High-resolution Grid and Plane Features","version":2},"cited_work":{"arxiv_id":"2303.03003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03003","snapshot_observed_at":"2026-08-06T21:49:48.322269Z","title":"Efficient Large-scale Scene Representation with a Hybrid of High-resolution Grid and Plane Features","venue":"cs.CV","work_id":"354ec982-a84f-4c26-9df5-9cfdb4531cbb","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.847955Z"},"links":{"cited_paper":"/paper/2303.03003","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:ea11f3ab60a9e5e059c4cade1d7455c9c724ef1df34b8e7848737f6d0d6ac05d","observation_id":"a6fde006-503c-4e13-a313-7da9fb1a1243","resolution":{"observed_at":"2026-08-06T21:49:48.374875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:49.657807Z","title":"Aerial lifting: Neural urban semantic and building instance lifting from aerial imagery","venue":null,"work_id":"707129df-d965-42b3-ae6f-f5fb99d231c4","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.900648Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:f27cd14a213b3bd313494366636bd75bfabedc316632e8a554d174b15aca53e4","observation_id":"a7ef6112-0d56-40b4-8e46-add371eadc78","resolution":{"observed_at":"2026-08-06T21:49:49.770435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:49.408607Z","title":"Rs5m and georsclip: A large-scale vision- language dataset and a large vision-language model for remote sensing","venue":null,"work_id":"c4d5ccec-a593-4a83-90bd-1eada7ace1df","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.958787Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:06be5e1c9a45dc413b53c9ea98ed5f6cf89919238f4440b1b2f0854075721250","observation_id":"de21f140-582b-4c75-9827-6bbac2003409","resolution":{"observed_at":"2026-08-06T21:49:49.525950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:49.176618Z","title":"Mutual Attention Inception Network for Remote Sensing Visual Question Answering","venue":null,"work_id":"4e2dccd2-3bcd-4d6e-9d69-50689145a6ea","year":2021},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:48.037601Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:b8ecdbc0b8f5b7caf53ec417870a405be4c52ed62db4aafa6ee6a8513d7e335a","observation_id":"861b8f96-6aef-48a5-9807-82467594e760","resolution":{"observed_at":"2026-08-06T21:49:49.261423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:49.045710Z","title":"Drivinggaussian: Composite gaussian splatting for surrounding dynamic au- tonomous driving scenes","venue":null,"work_id":"eb373c2b-14e7-4586-9258-16ed88707bf9","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:48.120675Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:03e0b7a7621db2a8745fc1192bb88faab1091ec645773e25b7d33cb5c289ee17","observation_id":"e9afdf7b-ffbb-44f9-8cac-136746af8ab1","resolution":{"observed_at":"2026-08-06T21:49:49.088711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:48.162222Z","title":"Towards vision- language geo-foundation models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:48.162222Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:cebc7a6b997845451e93010edbfbf98f3741fbd5982cb9e00950543f5f35529b","observation_id":"067fb573-df17-4484-9755-f991eb3f2950","resolution":{"observed_at":"2026-08-06T21:49:48.162222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:48.876936Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"2335dff3-7a17-4a04-91c5-64a1d7720a27","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:48.227457Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:7694daa71ca5cf65ed7dba23f7fd3cd550c3b2b6b750cc07049603610e3993c0","observation_id":"665b8c4d-6538-4db8-9d99-a80c8c9f3ed5","resolution":{"observed_at":"2026-08-06T21:49:48.941651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:48.733635Z","title":"'yes' if {ANSWER1} < {ANSWER2} else 'no'","venue":null,"work_id":"d496eee2-a099-427d-b48e-07a82e6f0e92","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:48.230001Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:074835379478c9e50f234dccb32bcc5761770ec64ff02c4050956f978d2686ff","observation_id":"0eddabe3-4fb5-4160-a229-5338d77d636e","resolution":{"observed_at":"2026-08-06T21:49:48.805064Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:42:32.697896Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":64},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2506.23352."}