{"as_of":"2026-08-17T05:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce1a6d31bbed32ce3ab2da874b25b8913dfd158a306a4776f5151d2568a32f68","coverage":[{"denominator":106,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:46:12.494249Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:19:20.192163Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T15:19:20.262812Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"cited_work":{"arxiv_id":"2507.04664","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.04664","snapshot_observed_at":"2026-08-06T15:19:20.262812Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","venue":"cs.CV","work_id":"744535db-4319-43b4-ba69-c3c8eaa3750e","year":2025},"citing_paper":{"arxiv_id":"2507.16251","last_updated":"2025-07-22T05:55:00Z","snapshot_observed_at":"2026-08-16T16:46:06.688917Z","submitted_at":"2025-07-22T05:55:00Z","title":"HoliTracer: Holistic Vectorization of Geographic Objects from Large-Size Remote Sensing Imagery","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:20.192163Z"},"links":{"cited_paper":"/paper/2507.04664","citing_paper":"/paper/2507.16251"},"observation_digest":"sha256:fd0f5653e124f1fe1936b7cba93e4bef832ed72c2ba5d862e5fafdc0568968d5","observation_id":"03578315-1c94-4a01-a3a4-eb074b2e5e40","resolution":{"observed_at":"2026-08-06T15:19:20.268713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04664","snapshot_observed_at":"2026-07-14T04:38:05.237334Z","title":"arXiv preprint arXiv:2507.04664 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11581","last_updated":"2026-07-13T14:00:57Z","snapshot_observed_at":"2026-08-06T16:55:31.542502Z","submitted_at":"2026-07-13T14:00:57Z","title":"Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-14T04:38:05.237334Z"},"links":{"cited_paper":"/paper/2507.04664","citing_paper":"/paper/2607.11581"},"observation_digest":"sha256:7719c0044f6b97f7f3b3b0b3e9dfef5395dda7178911a910fa471c6d648a619a","observation_id":"87847722-2f3c-4d59-87fc-5c8b6bb0e045","resolution":{"observed_at":"2026-07-14T04:38:05.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04664/citation-record","integrity":"/paper/2507.04664/integrity","json":"/paper/2507.04664/citation-record.json","paper":"/paper/2507.04664"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:10.920396Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:10.920396Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:6a6d9e0ed3f5d240cf6c668f7b4476c555e1f0642e74ec80f32663d8c84cc507","observation_id":"d8210e97-721d-4377-98c5-7fbcf411d4a1","resolution":{"observed_at":"2026-08-06T19:46:10.920396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:11.024550Z","title":"Efficient interactive annotation of segmentation datasets with polygon-rnn++","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.024550Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:8110b8d04f271f4d6724426637f373825f84685627db8a2e88a4cd61dd80432d","observation_id":"284f28ca-349f-44b6-a49a-aee047b86458","resolution":{"observed_at":"2026-08-06T19:46:11.024550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T19:46:11.125140Z","title":"et al., 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.125140Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:8c782b6c56c77686cfdeed571ee7b65777e765dcd509ea9454c45f2ab1bb8011","observation_id":"4ed2ba49-0e13-4285-bc0b-562f5b2176d5","resolution":{"observed_at":"2026-08-06T19:46:11.125140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T19:46:11.275037Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.275037Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:d527f4f622d283a4026576e7696ecb98b87720b5446c1e9fd67370c4f9f83a3b","observation_id":"63f16326-a8d3-47a3-9f67-0cafaf669179","resolution":{"observed_at":"2026-08-06T19:46:11.275037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:11.444690Z","title":"Multi-task learning for segmentation of building footprints with deep neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.444690Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:e211a62ec6c427575f540a223111438d56a9092e3e6fc61c6154329df73c865b","observation_id":"55a2e43a-de79-4c6a-94f2-51ed9ffe9dff","resolution":{"observed_at":"2026-08-06T19:46:11.444690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:11.605083Z","title":"J., 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.605083Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:60af7ac3d2536c7726406b04f1a1a095ce02d766b80494f1438b94e674d4d472","observation_id":"efa7c1c8-6e2f-4fcd-982f-bd06561d09ba","resolution":{"observed_at":"2026-08-06T19:46:11.605083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-06T19:46:11.735318Z","title":"et al., 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.735318Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:316b008c78d4eb1c52cac777909c39021770a8d0642c43a204cf955b71e0f14f","observation_id":"79d0203d-3bb3-4a7b-beee-c4685cd45c41","resolution":{"observed_at":"2026-08-06T19:46:11.735318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:11.861213Z","title":"Annotating object instances with a polygon-rnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.861213Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:469152eb7118d885b4462ae7af1467bb1bc81d0834e7ee4574a0a2da46f95cae","observation_id":"d361c8c1-8a8f-44a8-a1ab-8d1ea92df04e","resolution":{"observed_at":"2026-08-06T19:46:11.861213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.035880Z","title":"ASF-Net: Adaptive Screening Feature Network for Building Footprint Extraction From Remote-Sensing Images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.035880Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:e979387d9386626a7538cdcda445b85255a39889cff7476206c4f5652391c66e","observation_id":"d5c7e7e8-8b92-4f60-8cc8-4beaa3a6d456","resolution":{"observed_at":"2026-08-06T19:46:12.035880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.044430Z","title":"RSPrompter: Learning to prompt for remote sensing instance segmentation based on visual foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.044430Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:ffc078570d3414bddef8176388386b58be8c20f7de40a73f2328166fea6b7731","observation_id":"e9ed3f77-ac4b-48de-844d-899ff0a7eb35","resolution":{"observed_at":"2026-08-06T19:46:12.044430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.108746Z","title":"L., Liu, X., 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.108746Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:48088aff8ac6bde9af4dcde09a9ec21743df86a91506b3799f4b0ecc153cea29","observation_id":"676c25f8-9990-409e-9867-bed03307dcbc","resolution":{"observed_at":"2026-08-06T19:46:12.108746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.113348Z","title":"CGSANet: A Contour-Guided and Local Structure-Aware Encoder--Decoder Network for Accurate Building Extraction From Very High-Resolution Remote Sensing Imagery","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.113348Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:4c0907f4b2ccf981f42d4db4ab0babec302ddc91cc558f9410f61d4574611a10","observation_id":"0f688f2a-513d-4336-8c6b-2217dd18266d","resolution":{"observed_at":"2026-08-06T19:46:12.113348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T19:46:12.118150Z","title":"et al., 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.118150Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:f7e246c2dc3cd4de68189a6734aa359bdf27ba93b5e68f62c65ed059555e2d5a","observation_id":"2c0fb206-cf12-4d86-85e9-95a803d45295","resolution":{"observed_at":"2026-08-06T19:46:12.118150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T19:46:12.123184Z","title":"et al., 2024c","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.123184Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:a60aa83a33351eafb76b4bfb96c6ba30d95d2e6af9f717e5426c47ba1d96c71e","observation_id":"098777dd-1745-4fc0-8d9d-fa06d2e57f0b","resolution":{"observed_at":"2026-08-06T19:46:12.123184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.128509Z","title":"et al., 2024d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.128509Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:bec6a07588acf80181bdf27d4634afcdac7c4731b467c0262f9bd17ec775503e","observation_id":"37d15ac5-d595-4ae6-85ce-e59ac22db8af","resolution":{"observed_at":"2026-08-06T19:46:12.128509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.132674Z","title":"G., Kirillov, A., Girdhar, R., 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.132674Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:52f12fa48c53b0539ee4128194e554ef1bed440223461cfb41e10a4e50144dd2","observation_id":"4a946523-bd2f-4276-853f-43490e74626e","resolution":{"observed_at":"2026-08-06T19:46:12.132674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.140442Z","title":"E., Stoica, I., Xing, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.140442Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:7b817609cf5538afd7469a26fca5786ea4e4ea92ea13b55ecda2007be130bf1f","observation_id":"ee994916-5335-4e80-af27-bb9bd9bc5ecf","resolution":{"observed_at":"2026-08-06T19:46:12.140442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T19:46:12.145107Z","title":"et al., 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.145107Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:25e37c724221430288368b5b63ec433397ccd0268399d87b4834a4828eeacc4c","observation_id":"03a7438f-6450-4b4f-b99e-11d5ef313a01","resolution":{"observed_at":"2026-08-06T19:46:12.145107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.149426Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.149426Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:9ccfd002ff1a25d45040ab82d8b0042df90f7accca83609c375b4bdee965052c","observation_id":"72388a81-c250-4eec-a565-219e61eab721","resolution":{"observed_at":"2026-08-06T19:46:12.149426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T19:46:12.153773Z","title":"et al., 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.153773Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:fe4ac66f882b518173dab42ed97d8cee2176b69d75455a65b0013263d13cc29e","observation_id":"f9a3c9a8-4cf6-4041-a84b-2654ce84d911","resolution":{"observed_at":"2026-08-06T19:46:12.153773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19552","last_updated":"2025-05-21T19:12:41Z","snapshot_observed_at":"2026-08-16T13:05:57.120510Z","submitted_at":"2024-10-25T13:26:32Z","title":"GeoLLaVA: Efficient Fine-Tuned Vision-Language Models for Temporal Change Detection in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19552","snapshot_observed_at":"2026-08-06T19:46:12.158072Z","title":"Geollava: Efficient fine-tuned vision-language models for temporal change detection in remote sensing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.158072Z"},"links":{"cited_paper":"/paper/2410.19552","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:c72966ea49fb55509eee6d91b5d23ef0ad385cf2a80d84fa8c63014d66dd187f","observation_id":"402e5d75-ed0f-4680-a137-99357aa52267","resolution":{"observed_at":"2026-08-06T19:46:12.158072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.162712Z","title":"Instances as queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.162712Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:51770f16f8c8b1b8079e40cf089d4625ee7442fae543d27a880fedeae48a0933","observation_id":"2644427a-76f4-458a-ae86-b42183c9ab8c","resolution":{"observed_at":"2026-08-06T19:46:12.162712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.166733Z","title":"GPT-3: Its nature, scope, limits, and consequences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.166733Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:e65ace37fa0004e9f69f3eaa2b4c4d7f2980e7483981cf89634477ffb422069b","observation_id":"3417c8d8-f6f3-49f5-80c0-f6220469bb90","resolution":{"observed_at":"2026-08-06T19:46:12.166733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.170835Z","title":"Polygonal building extraction by frame field learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.170835Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:0fad17ee48cf46ca49d176c55e6d4531b10f2104052855e505b970072740819f","observation_id":"22fb0106-5f5a-4949-b4c3-7d169df1fd6e","resolution":{"observed_at":"2026-08-06T19:46:12.170835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09083","last_updated":"2024-01-17T09:44:07Z","snapshot_observed_at":"2026-08-16T14:26:51.081143Z","submitted_at":"2024-01-17T09:44:07Z","title":"Remote Sensing ChatGPT: Solving Remote Sensing Tasks with ChatGPT and Visual Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09083","snapshot_observed_at":"2026-08-06T19:46:12.175344Z","title":"Remote sensing chatgpt: Solving remote sensing tasks with chatgpt and visual models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.175344Z"},"links":{"cited_paper":"/paper/2401.09083","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:94fb2457f2984c854758ec02b8a1852fcf8dca647e251cd1dc5fd083ecd1e084","observation_id":"fec73877-e797-40a4-a79b-5ad3e5d28eec","resolution":{"observed_at":"2026-08-06T19:46:12.175344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.179579Z","title":"HigherNet-DST: Higher resolution network with dynamic scale training for rooftop delineation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.179579Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:ec16c7fb84650994bea6352f5e01786fc896318fddbf57c6458d132bc5d18615","observation_id":"f238ad8e-3b6b-43ad-8503-5e493a6da9c9","resolution":{"observed_at":"2026-08-06T19:46:12.179579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.183884Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.183884Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:17635fac6860696aa23a32311c7dc60ed96a2922ccf0d38862941e63442ccb9b","observation_id":"c8a427c6-96d6-4c74-a134-891fa92077fc","resolution":{"observed_at":"2026-08-06T19:46:12.183884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.187715Z","title":"Rsgpt: A remote sensing vision language model and benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.187715Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:738e94f796037ee25f040db95e1f97f3680f6e82f8b0e17ca68a3c8221bbb9b0","observation_id":"d390bb96-5275-4feb-ae74-c349d1d523d6","resolution":{"observed_at":"2026-08-06T19:46:12.187715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.191988Z","title":"Sequentially delineation of rooftops with holes from VHR aerial images using a convolutional recurrent neural network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.191988Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:54f9254752e2ea1ed670c5c152fb51d6e2f6492ba696e5bc098200bc1a6a8315","observation_id":"7a2c0461-438f-4b96-87cb-4627b4b0c473","resolution":{"observed_at":"2026-08-06T19:46:12.191988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.196441Z","title":"OEC-RNN: Object-oriented delineation of rooftops with edges and corners using the recurrent neural network from the aerial images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.196441Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:87371439e61b5b6d0bf18ee4b852a35850d049b05192b0a75d30edcedf54492c","observation_id":"4336df52-0d5d-43e9-9c6c-c7e0fb34713f","resolution":{"observed_at":"2026-08-06T19:46:12.196441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06234","last_updated":"2025-01-27T01:45:15Z","snapshot_observed_at":"2026-08-16T13:11:24.808006Z","submitted_at":"2024-10-08T17:45:51Z","title":"TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06234","snapshot_observed_at":"2026-08-06T19:46:12.200812Z","title":"A., Liu, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.200812Z"},"links":{"cited_paper":"/paper/2410.06234","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:d11bbfa08c6d6831012d6f435386b5e5962fe007264411b109c1acf3c869957c","observation_id":"09dde30f-882b-419e-83a3-f1e85ca77997","resolution":{"observed_at":"2026-08-06T19:46:12.200812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.205089Z","title":"Fully convolutional networks for multisource building extraction from an open aerial and satellite imagery data set","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.205089Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:3a3c8ff4237718cba1d2b819fdeeaae382f4d633fa85c4aa8134d10923fe7246","observation_id":"7d30da99-0abc-453d-b115-07c3af35c33e","resolution":{"observed_at":"2026-08-06T19:46:12.205089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.209483Z","title":"A scale robust convolutional neural network for automatic building extraction from aerial and satellite imagery","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.209483Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:edef1d7d2bdbeaeb58bfd38a6baace965c81b7d92086b7fa5a3fe7ef22db021f","observation_id":"dcd086c9-29ac-424a-8f5d-3342a2617651","resolution":{"observed_at":"2026-08-06T19:46:12.209483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T19:46:12.214127Z","title":"C., Lo, W.-Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.214127Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:537d8d4ef053e991395c4ab294e7835859fa0178141aff616259fb8fb2a90781","observation_id":"889edfd5-384c-43d1-83c6-c19aae744b8c","resolution":{"observed_at":"2026-08-06T19:46:12.214127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.218573Z","title":"C., Lo, W.-Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.218573Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:1b1b673efcc3936145da3a5c06bbfe2f579e07ef1bb6a513070d5036c325ead7","observation_id":"54e8859c-9ea6-43ac-868d-0d2187b98f52","resolution":{"observed_at":"2026-08-06T19:46:12.218573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.222970Z","title":"E., 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.222970Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:c129e44594d008ed0910ee66b793c793139275082511f987280b6a3776e58f76","observation_id":"62b9df7f-f2c1-4fa1-99c1-dd732c0569ce","resolution":{"observed_at":"2026-08-06T19:46:12.222970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.227214Z","title":"S., Naseer, M., Das, A., Khan, S., Khan, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.227214Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:6bedb23ac909dc4f16da0a408d2b5b711a85c90c1e9d5992029e1c27bc38d66b","observation_id":"a82c35c5-a1ed-4198-92a3-a2b2040f4336","resolution":{"observed_at":"2026-08-06T19:46:12.227214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.764109Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"7ccc53b4-9da5-4a66-b52e-9aaf5539e856","year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.231466Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:9ed49c61e0a9b9e7c5359f7528b417c0465a6e425ed5352b9d1436ceb45c72e5","observation_id":"bf74aaef-e9c3-4173-8e2e-12842ec9cdaa","resolution":{"observed_at":"2026-08-06T19:46:13.768609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12384","last_updated":"2024-11-11T17:25:20Z","snapshot_observed_at":"2026-08-16T13:41:55.916637Z","submitted_at":"2024-06-18T08:15:21Z","title":"VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12384","snapshot_observed_at":"2026-08-06T19:46:12.235897Z","title":"VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.235897Z"},"links":{"cited_paper":"/paper/2406.12384","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:405397531ad5b5ff4eca16c6858db54c5aa2c230f8754669580e4f9325198679","observation_id":"83f5ad00-4f16-4c13-ae3c-d5093f990ca2","resolution":{"observed_at":"2026-08-06T19:46:12.235897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01497","last_updated":"2019-11-29T12:34:35Z","snapshot_observed_at":"2026-08-14T17:48:42.995941Z","submitted_at":"2018-12-04T15:52:52Z","title":"Topological Map Extraction from Overhead Images","version":3},"cited_work":{"arxiv_id":"1812.01497","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.01497","snapshot_observed_at":"2026-08-06T19:46:12.805820Z","title":"Topological Map Extraction from Overhead Images","venue":"cs.CV","work_id":"82cc6ef9-2886-40af-acc8-fce2ae911659","year":2018},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.240475Z"},"links":{"cited_paper":"/paper/1812.01497","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:abcbda01611eca138bba8001aad39d19be4e125e4331be2936c0ee426680b0cd","observation_id":"c7f65599-2566-4ca8-946f-9be25206b819","resolution":{"observed_at":"2026-08-06T19:46:12.810473Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.746328Z","title":"D., Lucchi, A., 2019","venue":null,"work_id":"039096d6-a86c-4eda-87ce-09edafa1c03d","year":2019},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.247118Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:6bc99430df80714a9233c8046ae7b539ac773419d526cc3ad81c00f9329f3e92","observation_id":"3ce7b139-c1b1-4957-8785-0d8f624a62bc","resolution":{"observed_at":"2026-08-06T19:46:13.750718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.731064Z","title":"Polytransform: Deep polygon transformer for instance segmentation","venue":null,"work_id":"34c836ab-d487-49c9-8517-c15c22949c50","year":2020},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.251308Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:8311fe4e1157189606b04d3ca0efdfc1ada2e4ac87cf5c1c4695b57fa6aa5d07","observation_id":"f2c10974-566d-4cc7-91ad-596ab7bb7a93","resolution":{"observed_at":"2026-08-06T19:46:13.735684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:12.255657Z","title":"L., 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.255657Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:627745596e100997fe208f399b0169a7f700c6b0b22fbd3dec476d1368f7c081","observation_id":"d37fc12e-ba8d-4aed-8492-ab0056e2f0a9","resolution":{"observed_at":"2026-08-06T19:46:12.255657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.705840Z","title":"Draw-and-understand: Leveraging visual prompts to enable mllms to comprehend what you want","venue":null,"work_id":"6ee603cc-9d3b-4ccb-9eaa-61c549173f95","year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.259708Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:4c081d9c2b49412250210308b8554b1ee8beb2afbd55da8e67c18524c9e9f59e","observation_id":"827c00df-b728-4e03-9d0f-d55d15100aa4","resolution":{"observed_at":"2026-08-06T19:46:13.709894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.692431Z","title":"Change-agent: Towards interactive comprehensive remote sensing change interpretation and analysis","venue":null,"work_id":"aad333e5-d533-4eaf-aa24-31d99c2b36f5","year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.263754Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:4da2f191f15fc55a5264738f848d8aa8e1cd22a66787c2ed7a59aee16988aa75","observation_id":"d0bbce28-e468-439e-99ca-15afbfcb788e","resolution":{"observed_at":"2026-08-06T19:46:13.696936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.679231Z","title":"J., 2023a","venue":null,"work_id":"50ab6d63-2e5a-4e75-9be4-b86bb2839030","year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.268556Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:ff1fb5340d58b211d63953e1005f83475bdfc3b7293b6d3b8cb6be534eec6af3","observation_id":"d3ad047d-f059-4b44-aadd-03e46058c842","resolution":{"observed_at":"2026-08-06T19:46:13.683383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.665180Z","title":"J., 2023b","venue":null,"work_id":"443882f1-68ff-4ee9-b704-c0d3e548c066","year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.272742Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:85a8b1a91f76e3cad2abc97bcb1eb20038f1483bcb0113fd6ced3af5abfa6f78","observation_id":"c9f2d888-2725-4ade-8a56-de7b935ab042","resolution":{"observed_at":"2026-08-06T19:46:13.669499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.650835Z","title":"Path aggregation network for instance segmentation","venue":null,"work_id":"1b830c82-0f9d-4813-aa3f-79858f48ccec","year":2018},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.277029Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:10106858ab33375650ab83bc94ea7017b22f19bc3509479e637bda3facdcdc45","observation_id":"78abfdac-54bd-486c-a69d-ede748ad8ac3","resolution":{"observed_at":"2026-08-06T19:46:13.655042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.637343Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"75e76e58-12e0-4bab-b543-6ee8601dad88","year":2021},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.281467Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:7342c9d67e1911a6d080af683b164140b02828d33861c22ac7faacfd7928b744","observation_id":"e24ef6bb-7b5e-4eb5-b2b1-cf06837ae3e4","resolution":{"observed_at":"2026-08-06T19:46:13.641484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.623265Z","title":"Building Outline Delineation From VHR Remote Sensing Images Using the Convolutional Recurrent Neural Network Embedded With Line Segment Information","venue":null,"work_id":"0d39a188-5b40-45ae-85bc-5d4d64ff2579","year":2022},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.286109Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:6fbbe811285e777a49ecd288bf18bee872dd571802acd930e5e8bf4d67a40b1a","observation_id":"ce1e00f3-4929-46f3-b4f9-6d7406b15fc6","resolution":{"observed_at":"2026-08-06T19:46:13.627700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-08-16T13:42:55.361342Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-06T19:46:12.290250Z","title":"et al., 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.290250Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:f6fc68c3d0494a78c550d2381b1365992522d1941780b848a22816e800b586d5","observation_id":"b13b024e-9a19-4236-ac5f-2454e73df9d4","resolution":{"observed_at":"2026-08-06T19:46:12.290250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.608828Z","title":"Cross-spatiotemporal land-cover classification from VHR remote sensing images with deep learning based domain adaptation","venue":null,"work_id":"13c21238-fc87-4958-af5d-729ecff2b1b2","year":2022},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.295054Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:db329109e098a16911a35cd7c48c4b0a742517a1545c2889d5f7075055ebfb53","observation_id":"1b14cb8b-87f3-46a5-958f-6c3c4d137129","resolution":{"observed_at":"2026-08-06T19:46:13.613358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.593498Z","title":"SAM-RSIS: Progressively adapting SAM with box prompting to remote sensing image instance segmentation","venue":null,"work_id":"97773607-3d0e-442b-816f-8734473841d3","year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.299089Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:30e1c233297d155b34651fe2716979129bd700d9582eb6f412e5810c22cdcfe5","observation_id":"686281e2-c5b5-4920-8bb8-32a113dcae3c","resolution":{"observed_at":"2026-08-06T19:46:13.597708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.577957Z","title":"P., 2019 (accessed November 10, 2019)","venue":null,"work_id":"29f96f23-4a58-4d19-85c9-e960969aedaa","year":2019},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.303073Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:2dad956c8890c0f02fa7f8c7a00b928f90cb91996930256208a73df7329f5a3e","observation_id":"29af8f0c-1af2-430f-bd2f-6a6bca28fb56","resolution":{"observed_at":"2026-08-06T19:46:13.583455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02544","last_updated":"2024-07-16T01:40:34Z","snapshot_observed_at":"2026-08-16T14:21:41.017997Z","submitted_at":"2024-02-04T15:46:43Z","title":"LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02544","snapshot_observed_at":"2026-08-06T19:46:12.307217Z","title":"Lhrs-bot: Empowering remote sensing with vgi-enhanced large multimodal language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.307217Z"},"links":{"cited_paper":"/paper/2402.02544","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:d44f5264032c15128406ec688bd5d089908f90e60b3bbb11b90ab4017f4ef279","observation_id":"8df539d9-a371-4125-b177-b49eacccc809","resolution":{"observed_at":"2026-08-06T19:46:12.307217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T19:46:12.311807Z","title":"et al., 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.311807Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:27a31b04a320b34adb6c67b836725009d075e43fe7c49cd3a3aa1dcf3797faad","observation_id":"128196e5-76c8-4d90-b068-f37701d3c630","resolution":{"observed_at":"2026-08-06T19:46:12.311807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20213","last_updated":"2024-12-19T13:46:40Z","snapshot_observed_at":"2026-08-16T14:05:11.144060Z","submitted_at":"2024-03-29T14:50:43Z","title":"VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20213","snapshot_observed_at":"2026-08-06T19:46:12.316595Z","title":"et al., 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.316595Z"},"links":{"cited_paper":"/paper/2403.20213","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:5a0c23a06b0fb49f818ac8ee752db76a2cbcde63b94c36fcce2678832b6bd045","observation_id":"3f4aace0-37a0-4b07-b11b-ba9fbb559ba7","resolution":{"observed_at":"2026-08-06T19:46:12.316595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.562421Z","title":"Deep snake for real-time instance segmentation","venue":null,"work_id":"db5557a0-188a-4f92-98a0-975d31b63566","year":2020},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.320655Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:6d131abf5a5701bfcb602741bd363bdfe9931626bc508b784d915e088f12a7dd","observation_id":"f887536e-9793-4d10-97a4-26108a357f69","resolution":{"observed_at":"2026-08-06T19:46:13.567120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.547037Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J","venue":null,"work_id":"12db2070-9165-4f07-845d-cb63e9922470","year":2021},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.324853Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:7dc68e43a5f1b2e723eccf8b2be28d5fa37ac8c334a1568fed5f40156a1bdbc3","observation_id":"4c97ddd7-5460-4792-b3ba-aa1775f656b2","resolution":{"observed_at":"2026-08-06T19:46:13.552334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.532427Z","title":"D., Ermon, S., Finn, C., 2024","venue":null,"work_id":"b09b3194-7f6c-4460-bf83-41fb6cad59ae","year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.328747Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:9010f11818f010eb25d975fc069a9038abef6576ac38de195629b0bc8aea9b60","observation_id":"c54176be-9c7f-44e2-8812-74181bd3f3f5","resolution":{"observed_at":"2026-08-06T19:46:13.536754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.514235Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":"0c8bf984-6c5d-493e-b725-1e618462b25b","year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.332948Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:e2ef0de76a1ae4160a4b9762820145b81d312209458a1482bb65d3f5e2cc3301","observation_id":"0cd113dd-ee83-4552-b263-db1eb4fa46d9","resolution":{"observed_at":"2026-08-06T19:46:13.521226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.500232Z","title":"M., Xing, E., Yang, M.-H., Khan, F","venue":null,"work_id":"49cd6ee8-a3b0-439f-9475-dadca7ea6802","year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.336760Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:61ac7f5bad5507bd06ec7195434bec98ec7f4ff1dcac26e250cb51ee90f1fe29","observation_id":"aba2b761-0c8c-4030-8fed-7672c527f1fd","resolution":{"observed_at":"2026-08-06T19:46:13.504453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.485791Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"aac1ffbc-e8cc-40a6-bca2-0afc7856c80b","year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.340577Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:68add70bbe1d65806bae4b62bc1f1afaf7b4756750217711355618d869de816d","observation_id":"9aad2ccb-9034-46e9-a8aa-bd39225ce36f","resolution":{"observed_at":"2026-08-06T19:46:13.490327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.469654Z","title":"Geollm-engine: A realistic environment for building geospatial copilots","venue":null,"work_id":"25a8d05c-1458-4e2f-bc20-f40a79ad666b","year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.345906Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:b5169a07b22635cbcf34314eaad6d628f7ccc24d03b14eb82798617cb997bb42","observation_id":"540c0d6d-2bb8-433d-807a-fc007055224f","resolution":{"observed_at":"2026-08-06T19:46:13.473850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.455227Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities","venue":null,"work_id":"caa69590-a49d-410a-ad8f-9914dc1a62ff","year":2023},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.350574Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:8914867151384cf8123e26e411944d2043e7629291feb441adb7d976f80b5bcb","observation_id":"cc1b2af8-ef4a-471e-9c88-355c64381b81","resolution":{"observed_at":"2026-08-06T19:46:13.459916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.441859Z","title":"Fcos: Fully convolutional one-stage object detection","venue":null,"work_id":"b17356e4-0739-4267-9bd7-9c4c2f8fc642","year":2019},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.354993Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:a4a1fbda0dd53722b6fc45c89f45d5b633e0656b64ff95e54af3a582e98ea98f","observation_id":"df3fd4f0-9393-4133-a26b-81021c816039","resolution":{"observed_at":"2026-08-06T19:46:13.446080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T19:46:12.359024Z","title":"et al., 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.359024Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:fce4a028149875271601092d3f2a0cf95046059217639bb104bcab294917ecc2","observation_id":"c75b4a2d-c816-4c9d-afe0-9087289aa521","resolution":{"observed_at":"2026-08-06T19:46:12.359024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.428377Z","title":"From image transfer to object transfer: Cross-domain instance segmentation based on center point feature alignment","venue":null,"work_id":"fe9cfc54-eef1-4db7-8069-edab7602b762","year":2023},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.363048Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:5fe7a501d19051b8bd63138213f7a01e480ed2adeee618c1943ab4ad81f752fa","observation_id":"5fb2122f-b754-48a1-937a-73536643f55e","resolution":{"observed_at":"2026-08-06T19:46:13.432782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T19:46:12.367046Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.367046Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:7fa427ba44be27b3e79042e6cb2431adf7d5299243c1d890e156b1c7440596cf","observation_id":"33524a30-b01d-41a9-a075-6ef26917ce84","resolution":{"observed_at":"2026-08-06T19:46:12.367046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.414281Z","title":"et al., 2024b","venue":null,"work_id":"63b3a405-f2d8-422c-a9be-feb1b209b6e4","year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.371187Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:feb61263c36e912782ceeee4b76f65fec536bcf30b7fea913e6eb935bb516096","observation_id":"e4eb0793-f138-4d14-bd7d-67ba16e7bf46","resolution":{"observed_at":"2026-08-06T19:46:13.418753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.400912Z","title":"Solo: Segmenting objects by locations","venue":null,"work_id":"1f4620b6-bed6-4223-84ae-2111f6b20eb7","year":2020},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.375385Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:bf48f34fd5fe85adfb5d04ea256c12758f729cb87bb5452f4cdcf38a2d0783f9","observation_id":"54bb2a9e-a2c6-4242-9dfc-8fcac75dd936","resolution":{"observed_at":"2026-08-06T19:46:13.405054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.386746Z","title":"Skyscript: A large and semantically diverse vision-language dataset for remote sensing","venue":null,"work_id":"44d89353-ab58-426d-8802-65d278b5e5bb","year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.379117Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:8f294506c983b086b1a513f56e967c8b9d7cd84869b19db5c279139958edec3a","observation_id":"120e7511-4cf5-4df1-9071-b019c8b8f415","resolution":{"observed_at":"2026-08-06T19:46:13.391338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.372224Z","title":"Graph convolutional networks for the automated production of building vector maps from aerial images","venue":null,"work_id":"cd7e38a2-b5e9-49f3-8286-0fd1d38e9efd","year":2021},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.383357Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:bcc6a388650556415ae39cb13caf2fa24ff4f622d6c560e05b4cb473fa0a2ec6","observation_id":"20acfc7f-f109-4a06-ac92-5b3d82a53cde","resolution":{"observed_at":"2026-08-06T19:46:13.376449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.356439Z","title":"Toward automatic building footprint delineation from aerial images using CNN and regularization","venue":null,"work_id":"934e5be0-b14c-4d06-a435-a517f5a7f6cf","year":2019},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.387107Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:dfb4991488f204b21f621e070e7c5b4227dc9e52d0e2bbe3bf7d75377a84ac02","observation_id":"bc4e1410-b3d9-43c9-9dc1-bae1c1a1f4d7","resolution":{"observed_at":"2026-08-06T19:46:13.361186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.341856Z","title":"A Concentric Loop Convolutional Neural Network for Manual Delineation-Level Building Boundary Segmentation From Remote-Sensing Images","venue":null,"work_id":"62e7eb77-94a6-4f98-930e-3ba7a6bcb0e7","year":2021},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.391234Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:eb94c3d879c752bded7c6cae0e1734ab8b8ffcf84d0d729c847ca5ee8d202ebd","observation_id":"b74a44fc-cae6-4e8c-811c-15f90523039e","resolution":{"observed_at":"2026-08-06T19:46:13.346545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.328311Z","title":"BuildMapper: A fully learnable framework for vectorized building contour extraction","venue":null,"work_id":"77581307-c42b-4a14-8a09-b6c048b1b87d","year":2023},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.395043Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:c248c6b3ac7ee17597842d31aff9ee9048c30b499cd5a2f091949554fe6a66d2","observation_id":"681bfab7-2255-4e1e-8b9c-52960724f664","resolution":{"observed_at":"2026-08-06T19:46:13.332317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.314917Z","title":"From lines to Polygons: Polygonal building contour extraction from High-Resolution remote sensing imagery","venue":null,"work_id":"3a460f08-d4ec-4b0e-81bb-ede6c007b1d0","year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.399002Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:bab76e781694074cf606f4608c6a219f76112a5bd048c70d9f0e026833806a22","observation_id":"33d5c8b8-0ad6-43f7-b51f-561cfea87f99","resolution":{"observed_at":"2026-08-06T19:46:13.319037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.301120Z","title":"A., 2022","venue":null,"work_id":"24013829-bc68-4870-acf2-41a2f162d6a1","year":2022},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.403050Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:3167732caeca849ca6326489c367c6aeed9477e257316e9e57c612dc9368dc77","observation_id":"d6e94cea-aa35-4323-b476-edf1d9b58ca1","resolution":{"observed_at":"2026-08-06T19:46:13.305215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.285828Z","title":"Vectorizing historical maps with topological consistency: A hybrid approach using transformers and contour-based instance segmentation","venue":null,"work_id":"ab2dd105-2cd0-413d-a224-6e12dfe4fa0c","year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.406984Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:801cee95492b9b63a3266fa31c7ded131d67b52af917b8ebf14efc6622ff9df1","observation_id":"9e79cef5-9028-487b-a278-f3bfd73a6cdd","resolution":{"observed_at":"2026-08-06T19:46:13.291113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.271011Z","title":"Video instance segmentation is all you need for linking geographic entities from historical maps","venue":null,"work_id":"b8046da6-fc5a-494c-8c61-cb3855e41acb","year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.410892Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:d28365aa409c189bc3e52af34238477299b4e352608bdb4cfc2f3c2b21de27f6","observation_id":"05abb26e-ca00-4925-a7c1-12782aa2dbdc","resolution":{"observed_at":"2026-08-06T19:46:13.275145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.256607Z","title":"Polarmask: Single shot instance segmentation with polar representation","venue":null,"work_id":"d8299c5a-d045-426e-ab6d-4ee78c85581c","year":2020},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.415058Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:02adee47092952d1aaf97035d8915ce9bece5f99dc20e15ada1ab2d4b46815f5","observation_id":"d787037c-3fbf-4ccc-b604-62d610df6fde","resolution":{"observed_at":"2026-08-06T19:46:13.261366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.240939Z","title":"HiSup: Accurate polygonal mapping of buildings in satellite imagery with hierarchical supervision","venue":null,"work_id":"958ac3dd-12e0-4281-8b8f-bd2b62c33de6","year":2023},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.419407Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:1193a6cac62432765a74d402e03ec21d8b55013f9a548bdb7c15d52e10ee73c9","observation_id":"939ef4fa-5a08-4f74-aba5-74d9dfcd08bf","resolution":{"observed_at":"2026-08-06T19:46:13.246162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T19:46:12.423489Z","title":"et al., 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.423489Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:0a9065394a8e4baceb89fe5b24ad648d98b80e45b04050aac3376cb879f6c1e8","observation_id":"61e0fd6c-7086-41b8-a439-e08f2b35bd76","resolution":{"observed_at":"2026-08-06T19:46:12.423489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-16T18:57:50.930866Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T19:46:12.427552Z","title":"et al., 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.427552Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:01e76280b2b08e400e455c156fbab4cca009ccb12c6734db5754c9641d0bbc74","observation_id":"45a3c82f-e62d-44f6-be72-1e0b36778ccb","resolution":{"observed_at":"2026-08-06T19:46:12.427552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.226924Z","title":"A review of recurrent neural networks: LSTM cells and network architectures","venue":null,"work_id":"4eb7ee0d-46b4-4970-874e-0ad87106d413","year":2019},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.431291Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:fd3fa7167abe60842aa84c1d5b7b1c4bfaa512861e6fd3f0371702642e7685e1","observation_id":"02d2e529-04d6-463c-b965-a3a9370fd2c3","resolution":{"observed_at":"2026-08-06T19:46:13.231469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-16T10:23:40.545862Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-06T19:46:12.435161Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.435161Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:82ac62f1fd8e7a18b2210baf3cf64f60b1cb1e2f71005c2e2a6eefca8d5affd1","observation_id":"b59a960f-b2db-46c5-b692-a14e5a8fb91e","resolution":{"observed_at":"2026-08-06T19:46:12.435161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.212221Z","title":"Learning building extraction in aerial scenes with convolutional networks","venue":null,"work_id":"5a0f58da-229d-4596-a8ea-f521328574a3","year":2017},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.439134Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:07d09d7be2c6ad69d8ceac68fcf66a18867409a85e30cfc28ebe981d9f6611fc","observation_id":"90967185-4b8f-4448-80df-44aa4b22d059","resolution":{"observed_at":"2026-08-06T19:46:13.216943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.198296Z","title":"Osprey: Pixel understanding with visual instruction tuning","venue":null,"work_id":"3ad8dc21-a3db-4746-b923-bd0bedd972e7","year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.443193Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:705777e3e15d2032f7c657e7cc0da6cd155c5254b8f4849dbc891d4d80897d31","observation_id":"184b47f0-cbea-4043-99d8-a666a269c6b0","resolution":{"observed_at":"2026-08-06T19:46:13.202555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09712","last_updated":"2024-01-18T04:10:20Z","snapshot_observed_at":"2026-08-16T14:26:35.795079Z","submitted_at":"2024-01-18T04:10:20Z","title":"SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09712","snapshot_observed_at":"2026-08-06T19:46:12.447693Z","title":"Skyeyegpt: Unifying remote sensing vision-language tasks via instruction tuning with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.447693Z"},"links":{"cited_paper":"/paper/2401.09712","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:70ebfdeea63251fae17b2115433aca7f88131cd85cd0eb1f8b9e52cd24dcc0bc","observation_id":"22a3060a-2a1b-45da-a5e6-2f7ab87ee0dc","resolution":{"observed_at":"2026-08-06T19:46:12.447693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.184413Z","title":"HiT: Building Mapping with Hierarchical Transformers","venue":null,"work_id":"466a8f80-2928-4006-9968-c862bacb3601","year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.452471Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:f3c025af092ccbc61ecbc764753620500b53cbdf26f18d780c314c9af93c9a44","observation_id":"73189925-8303-4776-8873-e0f744cf96dd","resolution":{"observed_at":"2026-08-06T19:46:13.188633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.170227Z","title":"Gpt4roi: Instruction tuning large language model on region-of-interest","venue":null,"work_id":"099b6ac3-2375-46c3-82a3-61240731984b","year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.456326Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:7bf5b5e5251c40bd2b815b9f42e2b258cf59198dbfe9bfe1d757af69a0060f84","observation_id":"f294c6ba-585a-46ea-8119-03ae8b83043c","resolution":{"observed_at":"2026-08-06T19:46:13.174907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19389","last_updated":"2024-10-01T06:07:24Z","snapshot_observed_at":"2026-08-16T14:50:08.427255Z","submitted_at":"2024-06-27T17:59:01Z","title":"OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19389","snapshot_observed_at":"2026-08-06T19:46:12.460373Z","title":"C., Yan, S., 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.460373Z"},"links":{"cited_paper":"/paper/2406.19389","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:4eeb345a1fc6bdacb627c23a36cb274b6c5032bdeca10962aca07211164d14c3","observation_id":"d7f53afa-67ab-4129-8fb1-ac41a3f9eff3","resolution":{"observed_at":"2026-08-06T19:46:12.460373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10465","last_updated":"2025-04-14T17:52:22Z","snapshot_observed_at":"2026-08-16T12:41:13.823758Z","submitted_at":"2025-04-14T17:52:22Z","title":"Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10465","snapshot_observed_at":"2026-08-06T19:46:12.464562Z","title":"Pixel-sail: Single transformer for pixel-grounded understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.464562Z"},"links":{"cited_paper":"/paper/2504.10465","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:937b1b8e4064a700858ab832b065443a693ec9a3718e3ef3436974902aee1779","observation_id":"5d347ad1-9a51-40ec-851f-1a87105d9ce2","resolution":{"observed_at":"2026-08-06T19:46:12.464562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.155550Z","title":"E2ec: An end-to-end contour-based method for high-quality high-speed instance segmentation","venue":null,"work_id":"bf9b75a4-ffc7-4d7f-add7-f3534e09e32e","year":2022},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.468585Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:74a8273d26d8bf16f09416ce639217ab5eca301ec750065f5e6145be73158abf","observation_id":"f1eeaea0-1738-4a20-860f-427110480de5","resolution":{"observed_at":"2026-08-06T19:46:13.160009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.140566Z","title":"P2PFormer: A Primitive-to-polygon Method for Regular Building Contour Extraction from Remote Sensing Images","venue":null,"work_id":"c4b42664-ec18-4385-86a4-7ef1d56ebda2","year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.472846Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:40b1bdc15f2c23c3145e87f87377a6929638d3bb1a2a17b7fa231bf48d3b9452","observation_id":"75124c75-c625-4f0c-9a5d-d9db4f6e4197","resolution":{"observed_at":"2026-08-06T19:46:13.145458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03790","last_updated":"2024-06-13T06:46:14Z","snapshot_observed_at":"2026-08-17T02:03:47.011114Z","submitted_at":"2024-03-06T15:35:53Z","title":"Popeye: A Unified Visual-Language Model for Multi-Source Ship Detection from Remote Sensing Imagery","version":2},"cited_work":{"arxiv_id":"2403.03790","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.03790","snapshot_observed_at":"2026-08-06T19:46:12.590935Z","title":"Popeye: A Unified Visual-Language Model for Multi-Source Ship Detection from Remote Sensing Imagery","venue":"cs.CV","work_id":"ecf248d2-2909-49f4-9aa5-f95d7e2b3a38","year":2024},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.477081Z"},"links":{"cited_paper":"/paper/2403.03790","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:04193ca2160741e952b68237ab3276ace33d2020103796a3eb3d6511f51751bd","observation_id":"e38dff98-5106-4db9-b4a2-82426754e431","resolution":{"observed_at":"2026-08-06T19:46:12.597719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.126456Z","title":"Earthgpt: A universal multi-modal large language model for multi-sensor image comprehension in remote sensing domain","venue":null,"work_id":"001d57f8-c8ac-4aea-83a1-4a6aaf24c5fc","year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.481956Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:74883dbde102078683e81c3c83906468b73d6490ed9c8b2f69024b3346a03d9c","observation_id":"f2d2a953-4bb8-4b02-a514-c83c161a84e7","resolution":{"observed_at":"2026-08-06T19:46:13.130723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.112208Z","title":"RS5M and GeoRSCLIP: A large scale vision-language dataset and a large vision-language model for remote sensing","venue":null,"work_id":"6013bff9-7a39-400a-8c90-c0a1c9af36d7","year":null},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.486032Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:6167c1692fcb5ff8b659127c3527cc442865c25b76a87ddf9deff01dd421181d","observation_id":"a09fa0d4-3ad7-4110-88ca-09c776f96563","resolution":{"observed_at":"2026-08-06T19:46:13.117110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.097410Z","title":"Building extraction from satellite images using mask r-cnn with building boundary regularization","venue":null,"work_id":"8a80cc2b-3fb0-4d28-ab07-ee071cf1dce2","year":2018},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.490111Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:130e18a4ccd32927426b57895cee38ef1cff01681f1ba826636ca46b69826237","observation_id":"3a167d90-4e72-487e-a4cc-b679bf24355a","resolution":{"observed_at":"2026-08-06T19:46:13.102277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:46:13.080835Z","title":"Building instance segmentation and boundary regularization from high-resolution remote sensing images","venue":null,"work_id":"dc21c533-fb8b-4e5b-956a-a8e433665dcd","year":2020},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.494249Z"},"links":{"citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:bf29bc86cfe5d9df3a16ce2fe2def2c0376a4ffad7104f5bec7c4e1c7b3e1db2","observation_id":"c48c7d0f-3e53-4584-8f84-413a13286d3f","resolution":{"observed_at":"2026-08-06T19:46:13.085675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T16:47:36.907901Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":51,"verified_exact":1,"verified_fuzzy":47},"total_outbound_references":106},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 106 outbound references and 2 inbound Pith citation observations for arXiv:2507.04664."}