{"as_of":"2026-08-08T17:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a9618887f69d2324cc2e5404219b9cc863e908ac6f635d579ab12be5b0238cf","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:32:30.556929Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24340/citation-record","integrity":"/paper/2505.24340/integrity","json":"/paper/2505.24340/citation-record.json","paper":"/paper/2505.24340"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T12:32:29.518410Z","title":"A., Bach, N., Bahree, A., Bakhtiari, A., Bao, J., Behl, 6https://github.com/microsoft/ geo-vision-labeler 8 GeoVision Labeler H., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:29.518410Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:f35a64d5d827358d13726f43a45b335ea75dcd8e7258b0275f89d4229177a1d2","observation_id":"dad22c73-f48a-456d-92b5-cce0c37daba9","resolution":{"observed_at":"2026-08-07T12:32:29.518410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00125","last_updated":"2025-03-31T18:19:41Z","snapshot_observed_at":"2026-08-07T16:19:31.140226Z","submitted_at":"2025-03-31T18:19:41Z","title":"LLMs for Explainable AI: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00125","snapshot_observed_at":"2026-08-07T12:32:29.744760Z","title":"Llms for explainable ai: A comprehensive survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:29.744760Z"},"links":{"cited_paper":"/paper/2504.00125","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:50dcea3574ec0cb06bbdf598ef51380330ae0fa0c04926a422d08a6517ec39c9","observation_id":"1a0f4c1b-f7b7-4d64-ad80-0f0e38b51fae","resolution":{"observed_at":"2026-08-07T12:32:29.744760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07183","last_updated":"2022-12-01T17:38:37Z","snapshot_observed_at":"2026-08-08T07:53:13.926951Z","submitted_at":"2022-10-13T17:03:46Z","title":"Visual Classification via Description from Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07183","snapshot_observed_at":"2026-08-07T12:32:30.129101Z","title":"and V ondrick, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.129101Z"},"links":{"cited_paper":"/paper/2210.07183","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:8475dbf3ec90271224b69be49b243143b734c57b902fb876c213ba3dabc37120","observation_id":"d21fe554-45c5-4153-ac4d-f257fae3698e","resolution":{"observed_at":"2026-08-07T12:32:30.129101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T12:32:30.331687Z","title":"Peng, Z., Wang, W., Dong, L., Hao, Y ., Huang, S., Ma, S., and Wei, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.331687Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:d91daa5a72d293d6db18a1c0823b45dda99aa4a68cf1623cf9f4e9665418dd04","observation_id":"bd62e7a4-c7cf-44dc-9aa4-c8b5d0dbfdf5","resolution":{"observed_at":"2026-08-07T12:32:30.331687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11958","last_updated":"2021-05-20T19:12:39Z","snapshot_observed_at":"2026-08-06T23:42:51.134749Z","submitted_at":"2021-02-23T22:01:22Z","title":"The SpaceNet Multi-Temporal Urban Development Challenge","version":2},"cited_work":{"arxiv_id":"2102.11958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.11958","snapshot_observed_at":"2026-08-07T12:32:30.759939Z","title":"The SpaceNet Multi-Temporal Urban Development Challenge","venue":"cs.CV","work_id":"62289098-b00f-45bc-bfc9-052eb7e1c97e","year":2021},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.491776Z"},"links":{"cited_paper":"/paper/2102.11958","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:3a89110f9cd01c6aaf0a20694e19bd6e491245060c24399f5a3f216dba4aadbe","observation_id":"5531cd96-abb5-4fb5-987d-6041670511b4","resolution":{"observed_at":"2026-08-07T12:32:30.837086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:32:29.855808Z","title":"The Llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:29.855808Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:b41b466a57667959d6b964ab0252675590246e2184abefd3d10ea5b7ef634b0d","observation_id":"de1da1ea-d7b6-49c1-8044-8c25a2711e61","resolution":{"observed_at":"2026-08-07T12:32:29.855808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06721","last_updated":"2019-11-15T16:09:38Z","snapshot_observed_at":"2026-07-06T08:37:20.588424Z","submitted_at":"2019-11-15T16:09:38Z","title":"In-domain representation learning for remote sensing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.06721","snapshot_observed_at":"2026-08-07T12:32:30.216555Z","title":"S., Zhai, X., and Houlsby, N","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.216555Z"},"links":{"cited_paper":"/paper/1911.06721","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:237346c7fa18f2da081634499a22d7672210686af9e52b86f0f4fd8be3ed0ab7","observation_id":"70f415d4-94db-4251-8c1c-f1739eabfae4","resolution":{"observed_at":"2026-08-07T12:32:30.216555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18415","last_updated":"2024-11-03T18:23:45Z","snapshot_observed_at":"2026-07-06T18:21:30.595036Z","submitted_at":"2024-05-28T17:57:06Z","title":"Why are Visually-Grounded Language Models Bad at Image Classification?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18415","snapshot_observed_at":"2026-08-07T12:32:30.556929Z","title":"Why are visually-grounded lan- guage models bad at image classification? arXiv preprint arXiv:2405.18415,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.556929Z"},"links":{"cited_paper":"/paper/2405.18415","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:7bd5ef985be32ece4d66491ed13b5bdb8d6a9369f3a3e63c045f0812ef78d37b","observation_id":"22352f41-f8c3-4b2c-851f-73ded0b38e90","resolution":{"observed_at":"2026-08-07T12:32:30.556929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13364","last_updated":"2020-09-28T14:34:15Z","snapshot_observed_at":"2026-07-06T09:59:26.000400Z","submitted_at":"2020-09-28T14:34:15Z","title":"RS-MetaNet: Deep meta metric learning for few-shot remote sensing scene classification","version":1},"cited_work":{"arxiv_id":"2009.13364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.13364","snapshot_observed_at":"2026-08-07T12:32:31.226111Z","title":"RS-MetaNet: Deep meta metric learning for few-shot remote sensing scene classification","venue":"cs.CV","work_id":"179485f8-6ded-42dd-809d-7972926ba4ad","year":2020},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:29.945727Z"},"links":{"cited_paper":"/paper/2009.13364","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:397467c44b9b1aaad35c7d4e997826cb33ac19f4cbc795a2ffbdc6ce915a517b","observation_id":"3b9caf7d-bcce-49ff-8e1f-4aa3eb8e0df9","resolution":{"observed_at":"2026-08-07T12:32:31.280271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:31.484925Z","title":"Leverage weekly annotation to pixel-wise annota- tion via zero-shot segment anything model for molecular- empowered learning","venue":null,"work_id":"f0220278-a8c5-4584-8cb1-28f113dc5ad2","year":2024},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.014550Z"},"links":{"citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:8bb08646f8e95eeb22b1ef275910dd09f7703f25953883e50af1ba5f66c52c30","observation_id":"91c6165c-321b-4645-a026-080eaa4379fc","resolution":{"observed_at":"2026-08-07T12:32:31.546428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:32:29.646943Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:29.646943Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:24c72aab20bcc7d3ed26544a390fbea3769bfcb037c7c057192b67dbb461596a","observation_id":"613bf321-c6bf-4800-8cff-12924cffa3a6","resolution":{"observed_at":"2026-08-07T12:32:29.646943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05457","last_updated":"2025-04-07T19:46:59Z","snapshot_observed_at":"2026-08-07T16:07:48.289737Z","submitted_at":"2025-04-07T19:46:59Z","title":"Taxonomy-Aware Evaluation of Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.05457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.05457","snapshot_observed_at":"2026-08-07T12:32:30.926153Z","title":"Taxonomy-Aware Evaluation of Vision-Language Models","venue":"cs.CV","work_id":"92863d65-16b0-4fe4-a103-c4ba1280c7a0","year":2025},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.425414Z"},"links":{"cited_paper":"/paper/2504.05457","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:09ba1375b1771b12aa8e6791abdace075ee97bf5ceb060b3b7c5e49e288cf94b","observation_id":"74002761-3f58-4783-8bb4-a4d373d2fa3b","resolution":{"observed_at":"2026-08-07T12:32:30.994782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:22:38.191644Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2505.24340."}