{"as_of":"2026-08-15T14:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf915eac32bdfc760397848420c01e2762108f5e8dcfd4bb6aeb3e42bc342a77","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:53:49.353753Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:09:55.854741Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T00:48:24.793323Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-08-07T13:09:55.854741Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22627","last_updated":"2025-06-01T02:55:39Z","snapshot_observed_at":"2026-08-08T13:58:01.163947Z","submitted_at":"2025-05-28T17:45:55Z","title":"Chain-of-Talkers (CoTalk): Fast Human Annotation of Dense Image Captions","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:55.854741Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2505.22627"},"observation_digest":"sha256:e2b6c0280a1ddf368fb987f57a0ff3de475ca890dcccfce9c3e9566125e9c755","observation_id":"af11f5c5-d302-4dc7-a9f3-23d3a0e51e42","resolution":{"observed_at":"2026-08-07T13:09:55.854741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-08-06T19:21:13.258836Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05887","last_updated":"2025-07-18T12:41:26Z","snapshot_observed_at":"2026-08-07T20:54:26.650929Z","submitted_at":"2025-07-08T11:21:03Z","title":"GeoMag: A Vision-Language Model for Pixel-level Fine-Grained Remote Sensing Image Parsing","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:13.258836Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2507.05887"},"observation_digest":"sha256:a850855f9316e4dd3d168db976b77d5683ec9596d5c1339d5554266aa4e969f2","observation_id":"834d3338-f0eb-4b07-8389-c1ba5296fd3f","resolution":{"observed_at":"2026-08-06T19:21:13.258836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":"2501.06828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geopix: Multi-modal large language model for pixel-level image understanding in remote sensing.CoRR, abs/2501.06828","venue":null,"work_id":"5f65582c-66bb-466f-84ff-a42105b31a81","year":2025},"citing_paper":{"arxiv_id":"2603.21783","last_updated":"2026-08-13T08:49:59Z","snapshot_observed_at":"2026-08-15T13:14:55.480633Z","submitted_at":"2026-03-23T10:25:45Z","title":"SHARP: Spectrum-aware Highly-dynamic Adaptation for Resolution Promotion in Remote Sensing Synthesis","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T00:46:34.777585Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2603.21783"},"observation_digest":"sha256:5f6dcef6312bdefb26f2c701902a3a992264e09bc2b48ec336431e555f6ac2b5","observation_id":"73294226-ce04-4cd9-bb65-ad36eefdba9f","resolution":{"observed_at":"2026-05-15T00:48:24.795113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-07-14T20:17:28.243545Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.21783","last_updated":"2026-08-13T08:49:59Z","snapshot_observed_at":"2026-08-15T13:14:55.480633Z","submitted_at":"2026-03-23T10:25:45Z","title":"SHARP: Spectrum-aware Highly-dynamic Adaptation for Resolution Promotion in Remote Sensing Synthesis","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T20:17:28.243545Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2603.21783"},"observation_digest":"sha256:50298d1d0d78aebcaf905e22dfc96404621719ac6b28b2965b26e9a4ce9360cb","observation_id":"a421a2c2-4c4e-42fe-bacb-e066eecb8672","resolution":{"observed_at":"2026-07-14T20:17:28.243545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":"2501.06828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geopix: Multi-modal large language model for pixel-level image understanding in remote sensing.CoRR, abs/2501.06828","venue":null,"work_id":"5f65582c-66bb-466f-84ff-a42105b31a81","year":2025},"citing_paper":{"arxiv_id":"2604.15670","last_updated":"2026-07-24T04:48:23Z","snapshot_observed_at":"2026-08-14T16:26:32.722947Z","submitted_at":"2026-04-17T03:48:56Z","title":"PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T09:20:54.635375Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2604.15670"},"observation_digest":"sha256:411bbaaf97a20755b35ab627df64da98324a97606f413325da94c282e9e54ca6","observation_id":"6f3903d3-6baa-450f-87e1-bcfa7ce2f8bd","resolution":{"observed_at":"2026-05-10T09:23:37.112891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-08-02T16:10:02.323102Z","title":"Geopix: Multi-modal large language model for pixel-level image understanding in remote sensing.CoRR, abs/2501.06828, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.15670","last_updated":"2026-07-24T04:48:23Z","snapshot_observed_at":"2026-08-14T16:26:32.722947Z","submitted_at":"2026-04-17T03:48:56Z","title":"PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T16:10:02.323102Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2604.15670"},"observation_digest":"sha256:79d2b29fe8bb56d68c1280c698b49a8ff37da4f6d412747d53b062b9dacdd25d","observation_id":"6b1db3a5-69b2-4226-ab85-d9179c01d41b","resolution":{"observed_at":"2026-08-02T16:10:02.323102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06828","snapshot_observed_at":"2026-07-14T14:09:30.395518Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10120","last_updated":"2026-07-11T04:56:27Z","snapshot_observed_at":"2026-08-14T16:05:42.515947Z","submitted_at":"2026-07-11T04:56:27Z","title":"WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T14:09:30.395518Z"},"links":{"cited_paper":"/paper/2501.06828","citing_paper":"/paper/2607.10120"},"observation_digest":"sha256:1fa4ab7a47debafb9d0b135271f6829706ad771286a07b2e3df81c0328ec56d2","observation_id":"1b903af9-48f8-45b4-8a74-25804925781b","resolution":{"observed_at":"2026-07-14T14:09:30.395518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.06828/citation-record","integrity":"/paper/2501.06828/integrity","json":"/paper/2501.06828/citation-record.json","paper":"/paper/2501.06828"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.15266","last_updated":"2023-07-28T02:23:35Z","snapshot_observed_at":"2026-08-13T10:45:48.484753Z","submitted_at":"2023-07-28T02:23:35Z","title":"RSGPT: A Remote Sensing Vision Language Model and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15266","snapshot_observed_at":"2026-08-10T20:53:47.960477Z","title":"Rsgpt: A remote sensing vision language model and benchmark,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:47.960477Z"},"links":{"cited_paper":"/paper/2307.15266","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:92f05373a530a31b571c19784b94259449fceedb8caaba2fb6c5209e7d0de23e","observation_id":"b57f24db-3cc5-4524-b60a-e8a3273e966d","resolution":{"observed_at":"2026-08-10T20:53:47.960477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.398674Z","title":"Geochat: Grounded large vision- language model for remote sensing,","venue":null,"work_id":"771d0285-98dc-475a-a077-6203fd9f3fc8","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.024344Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:b65f522b7cc3b0e9e6ffefddfe140e3bb69c6afe2bd376cf9c959d6f5976ba6e","observation_id":"479916e7-27cf-4b1e-82f4-0518bc6bb86e","resolution":{"observed_at":"2026-08-10T20:53:50.402256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09712","last_updated":"2024-01-18T04:10:20Z","snapshot_observed_at":"2026-08-15T10:05:37.491633Z","submitted_at":"2024-01-18T04:10:20Z","title":"SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09712","snapshot_observed_at":"2026-08-10T20:53:48.029329Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.029329Z"},"links":{"cited_paper":"/paper/2401.09712","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:a1d5e1266da3fc824ad743a8d4ceec757a7aff46a427f4cb57943f0913398e08","observation_id":"c4737594-d29f-47d6-881d-6c84d4b989a5","resolution":{"observed_at":"2026-08-10T20:53:48.029329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.388481Z","title":"Earthgpt: A universal multi-modal large language model for multi-sensor image comprehension in remote sensing domain,","venue":null,"work_id":"c919ecc4-9a92-4024-95b0-0e38dcbbcfe0","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.034921Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:c646bdeb1c347c6f1cded3ac091b7e0c6e63a239e5b6dd810377c7fb9065e47a","observation_id":"e517ff45-b20f-4bf6-8563-74498db1a163","resolution":{"observed_at":"2026-08-10T20:53:50.392167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.378407Z","title":"Bb-geogpt: A framework for learning a large language model for ge- ographic information science,","venue":null,"work_id":"d575e695-580e-4d4e-857a-fc7fe415a904","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.039512Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:113ada9ea486b72be2e0d3dfae7a37bba39408e811216993f1beb86ba5b3c327","observation_id":"74407812-8a35-4aae-8fe8-744d5b6b82ba","resolution":{"observed_at":"2026-08-10T20:53:50.382002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02544","last_updated":"2024-07-16T01:40:34Z","snapshot_observed_at":"2026-08-13T04:27:18.680428Z","submitted_at":"2024-02-04T15:46:43Z","title":"LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02544","snapshot_observed_at":"2026-08-10T20:53:48.124779Z","title":"Lhrs- bot: Empowering remote sensing with vgi-enhanced large multimodal language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.124779Z"},"links":{"cited_paper":"/paper/2402.02544","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:ef103af870652da14e821f1867d99a23f139d24f5c6cb5c5d7e69764a43f3ee3","observation_id":"d87e0878-d02d-47c0-82e8-3265553242e3","resolution":{"observed_at":"2026-08-10T20:53:48.124779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.370350Z","title":"Mtp: Advancing remote sensing foundation model via multi-task pre- training,","venue":null,"work_id":"a79a625f-4b94-4caa-95d1-4a1f18b97bdc","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.225842Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:a1eec259b5b1f2afea5cd6a227ae609c86d09af5a52b3b6cf6beca6b26b050be","observation_id":"2db5c505-469c-4d4a-8d02-c746e5aa3b60","resolution":{"observed_at":"2026-08-10T20:53:50.373021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-08-12T23:42:36.797128Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-10T20:53:48.229191Z","title":"Skysensegpt: A fine- grained instruction tuning dataset and model for remote sensing vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.229191Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:ad0dbaf93b6f79a44020c83c00e21ada5c4cafc611f8d1174a0217eead202131","observation_id":"ed8fa80b-baed-4c4e-bb80-6eaef91a6e75","resolution":{"observed_at":"2026-08-10T20:53:48.229191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06234","last_updated":"2025-01-27T01:45:15Z","snapshot_observed_at":"2026-08-12T22:27:57.483365Z","submitted_at":"2024-10-08T17:45:51Z","title":"TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06234","snapshot_observed_at":"2026-08-10T20:53:48.233807Z","title":"Teochat: A large vision-language assistant for temporal earth obser- vation data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.233807Z"},"links":{"cited_paper":"/paper/2410.06234","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:85bc92cef6e7983932f75e02f53218e10c1fc3b282a5ad6b3c89165521eed432","observation_id":"b4ed543d-7b2f-49b6-8fd0-eaf5c210dcdf","resolution":{"observed_at":"2026-08-10T20:53:48.233807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.361305Z","title":"Earthmarker: A visual prompting multi-modal large language model for remote sensing,","venue":null,"work_id":"dfa2aa95-a9ff-4295-8485-1af9f4f7fae6","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.239203Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:20034517a9cf2b2f59ad7c7b1335cdae1dfba8df9598b9d88c8e572567710d59","observation_id":"44b65459-5320-461b-bf2a-5d9080062463","resolution":{"observed_at":"2026-08-10T20:53:50.365058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:48.243234Z","title":"Rsvg: Exploring data and models for visual grounding on remote sensing data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.243234Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:bb4b13c4446c07c3bdb19d40aad12664cd0ed5f62310a35f704a86db671d8610","observation_id":"fbd223b6-275f-4767-b043-163aaa67b744","resolution":{"observed_at":"2026-08-10T20:53:48.243234Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.352770Z","title":"Samrs: Scaling- up remote sensing segmentation dataset with segment anything model,","venue":null,"work_id":"78850e1b-04d5-4ca1-88a7-6dc674d5993e","year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.247566Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:f578d952e8a4af9a081a0c3441b1e4ebdf4b421175873ba44767cd29eb3ebc9d","observation_id":"74e8ace1-bf93-4ecc-9ce8-3337ffa99726","resolution":{"observed_at":"2026-08-10T20:53:50.355995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.343479Z","title":"Rrsis: Referring remote sensing image segmentation,","venue":null,"work_id":"d0432099-ce54-499e-a900-f9a8c52a6714","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.251055Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:f09807ebbd7809ef6e391eaba6366ccc362dae34271c3530dfaa41a8b3bbb004","observation_id":"676270de-e63e-4f45-8e34-f2115e1e0a37","resolution":{"observed_at":"2026-08-10T20:53:50.347108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12470","last_updated":"2024-04-02T05:37:25Z","snapshot_observed_at":"2026-08-13T04:58:50.714870Z","submitted_at":"2023-12-19T08:14:14Z","title":"Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation","version":3},"cited_work":{"arxiv_id":"2312.12470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.12470","snapshot_observed_at":"2026-08-10T20:53:49.952591Z","title":"Rotated Multi-Scale Interaction Network for Referring Remote Sensing Image Segmentation","venue":"cs.CV","work_id":"0edea39a-ffd7-4a79-83c8-fefb5ac009fe","year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.254286Z"},"links":{"cited_paper":"/paper/2312.12470","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:54619455871e191d55155982356b367e77bd08e881ca04450d0b466ef6643386","observation_id":"0a0d5c78-5d9e-465f-a00d-8f79f4e83ca6","resolution":{"observed_at":"2026-08-10T20:53:50.015691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12384","last_updated":"2024-11-11T17:25:20Z","snapshot_observed_at":"2026-08-14T09:28:57.175608Z","submitted_at":"2024-06-18T08:15:21Z","title":"VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12384","snapshot_observed_at":"2026-08-10T20:53:48.302408Z","title":"Vrsbench: A versatile vision-language benchmark dataset for remote sensing image understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.302408Z"},"links":{"cited_paper":"/paper/2406.12384","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:675dcf79bd4dc74600f33b96f60a825fa08d3b4b1a8c1c58abca736caa5a0047","observation_id":"e286015a-c9ee-4903-94b0-ece529454917","resolution":{"observed_at":"2026-08-10T20:53:48.302408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.331892Z","title":null,"venue":null,"work_id":"08d6cf46-4ca6-41fd-b3ad-47f6a4e0257c","year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.371796Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:93fe145feffd8fd96f413bd72c875e627c9935083a6f4ed4d62a9db7caabc694","observation_id":"e734e1a0-b2b5-494a-b871-5c8184f1f067","resolution":{"observed_at":"2026-08-10T20:53:50.336893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.321768Z","title":null,"venue":null,"work_id":"f534606f-df60-4dad-81c9-5bedf7ed4009","year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.375743Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:c13e27f38e3cc88fb68cc307308c86523c51e9d46ede0e6cc0ffd01702db3cbc","observation_id":"23036da1-0560-4222-9955-73812f1a3d9f","resolution":{"observed_at":"2026-08-10T20:53:50.325240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.312901Z","title":null,"venue":null,"work_id":"f231b707-4cb3-4f47-ad67-b846c6dee266","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.380182Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:4168acbc8c2cca6255daf85fc88af166153f0ba69d58c935b366077477c9a1a6","observation_id":"132a4d93-a91a-4b8d-bbd1-c496dcbb6acd","resolution":{"observed_at":"2026-08-10T20:53:50.316077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T20:53:48.385169Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.385169Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:ebc9c1e7b0b422431b4c3d15b2abd0b78046c95c1af7a65e74d469501f153ee5","observation_id":"60e82997-5cfc-43bd-a2fe-72a5345fbd19","resolution":{"observed_at":"2026-08-10T20:53:48.385169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-10T20:53:48.389986Z","title":"Minigpt-v2: Large lan- guage model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.389986Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:c1aeaf78621353a29fd3a9ad54c301915afd0592f77d38c0073f0d725c5b9e11","observation_id":"72c10116-e0cb-43bf-af8a-f827f1acfd0d","resolution":{"observed_at":"2026-08-10T20:53:48.389986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T20:53:48.394343Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.394343Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:4add7f3c80d15cd382f88615fa4751576d60333d11c3612b51d2f8073c1681b5","observation_id":"9f5833d6-7dd0-4bd2-9e0e-1dafa976c291","resolution":{"observed_at":"2026-08-10T20:53:48.394343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T20:53:48.427182Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.427182Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:fe766aa25dcf0511da21925e5b3b5bee54a65c7eec907b80bbede87b1b08a701","observation_id":"2ad8e6e5-a33a-4a77-a1b2-694f80493fcc","resolution":{"observed_at":"2026-08-10T20:53:48.427182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-10T20:53:48.493042Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.493042Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:43aa7b41e4415b1fc4b57840549bd1a74cf2cb557e605e2f0320dfe34968c4ca","observation_id":"d2218fbd-ede2-4ba3-9b6f-0d325e5b5a67","resolution":{"observed_at":"2026-08-10T20:53:48.493042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-10T20:53:48.528819Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.528819Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:f3039f049d509ac371776a942417887e09a77b56145fe7fa03506ebfa7cc4a97","observation_id":"4f6c3bab-f864-42f2-bede-2d92b567c5dd","resolution":{"observed_at":"2026-08-10T20:53:48.528819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-10T20:53:48.533532Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.533532Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:54c52a37d7f6858bd96dbcd7aad89ef81d0030ad31d6d49fbaa29005c067acfa","observation_id":"ed754b60-189c-4733-bfe6-b64d3a37e722","resolution":{"observed_at":"2026-08-10T20:53:48.533532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05662","last_updated":"2023-06-02T16:19:48Z","snapshot_observed_at":"2026-08-14T04:59:13.217854Z","submitted_at":"2023-05-09T17:58:34Z","title":"InternGPT: Solving Vision-Centric Tasks by Interacting with ChatGPT Beyond Language","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05662","snapshot_observed_at":"2026-08-10T20:53:48.539652Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.539652Z"},"links":{"cited_paper":"/paper/2305.05662","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:5b22b4977dd06530d1b9f3236680c498359a81f21272c7402693a338e488a11b","observation_id":"ddc7b7af-d2c7-45dc-a28a-874ae8c0d7c1","resolution":{"observed_at":"2026-08-10T20:53:48.539652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-10T20:53:48.544572Z","title":"Zhang, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.544572Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:8abad5dc18bc183f656b215aa2a72bf07877bd4e2a3e0fe99fb85eb8df4b489a","observation_id":"6a71dd86-2518-4f1c-b76f-f687a36fbd61","resolution":{"observed_at":"2026-08-10T20:53:48.544572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-10T20:53:48.548802Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.548802Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:013ff3a077771a7996de0fea9937b3323ab240d89241c738ec02c6d98072c4f9","observation_id":"57de04f7-f32d-42a0-82ae-abf953042751","resolution":{"observed_at":"2026-08-10T20:53:48.548802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-10T20:53:48.552690Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.552690Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:5412e702357541390d2b63f2e1779d39f201a86cd58564b67079ebeba97cbf34","observation_id":"b1f5dab7-0915-4a14-8676-0d8951c142fe","resolution":{"observed_at":"2026-08-10T20:53:48.552690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-10T20:53:48.556327Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.556327Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:cc7eff2767f21ac1e2cf203fbac766abec42e0b36ce803bc9d2f2a209887e2d1","observation_id":"ad57b2d2-6bb5-4359-90fd-37aa725ec24e","resolution":{"observed_at":"2026-08-10T20:53:48.556327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02228","last_updated":"2024-07-18T07:18:36Z","snapshot_observed_at":"2026-08-13T05:10:47.115897Z","submitted_at":"2023-12-04T03:05:59Z","title":"PixelLM: Pixel Reasoning with Large Multimodal Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02228","snapshot_observed_at":"2026-08-10T20:53:48.653877Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.653877Z"},"links":{"cited_paper":"/paper/2312.02228","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:61c609b275b80f0afec8ef8cbf10c3119a8ac0a81075bb76ec4bcb17cabe4f12","observation_id":"86681f54-61b8-4a88-a6f5-273f4ef7fc9f","resolution":{"observed_at":"2026-08-10T20:53:48.653877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13925","last_updated":"2025-01-23T18:59:30Z","snapshot_observed_at":"2026-08-15T03:53:36.276667Z","submitted_at":"2025-01-23T18:59:30Z","title":"GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13925","snapshot_observed_at":"2026-08-10T20:53:48.729794Z","title":"Shabbir, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.729794Z"},"links":{"cited_paper":"/paper/2501.13925","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:f9ab1d81e5daace9b00e6fb4596beca70cc478b389ff8f485f90543f5f7c0056","observation_id":"fac7f3f5-a830-40fd-8a84-133276b70349","resolution":{"observed_at":"2026-08-10T20:53:48.729794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.302351Z","title":"Object detection in optical remote sensing images: A 13 survey and a new benchmark,","venue":null,"work_id":"004d33af-b26c-49cd-8b99-0f1dd67bfac1","year":2020},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.733812Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:2de86015a45b524994f3dae7b19bf8778a7d56af939005a767f7b925f60b8f0d","observation_id":"a59bfb6a-f2d4-4226-9d05-6de0780ababb","resolution":{"observed_at":"2026-08-10T20:53:50.306212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.292176Z","title":"Object detection in aerial images: A large-scale benchmark and challenges,","venue":null,"work_id":"853624c1-91a1-4bcc-bbde-3030fcfa51c4","year":2021},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.844459Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:83760aeef0779ffec06a3a2714b0fe94c1c71a9a742cb56fa9b9ac5fd852e7a9","observation_id":"69fb0bfc-0a14-469f-b565-175e31227b04","resolution":{"observed_at":"2026-08-10T20:53:50.295806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:48.915827Z","title":"Fair1m: A bench- mark dataset for fine-grained object recognition in high- resolution remote sensing imagery,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.915827Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:f3aa74861b91cebead35943e37031c72ba5899d9d06a2ac4e4d622a9c9c0df41","observation_id":"c07902bd-c878-46fc-8958-fed9ce27a3a1","resolution":{"observed_at":"2026-08-10T20:53:48.915827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2017.26859","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:49.685226Z","title":"Aid: A benchmark data set for performance evaluation of aerial scene classification,","venue":null,"work_id":"4a965c01-bdef-4321-b85a-866e06c2b3ed","year":2017},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.920809Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:ae239c05f1372cf43541ee3ea9f2e5c944670da87e3ee8a74bf1d26f73839f3b","observation_id":"74699657-9a64-4fbe-815b-0bff53a95b28","resolution":{"observed_at":"2026-08-10T20:53:49.755682Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:48.924161Z","title":"Nwpu-crowd: A large-scale benchmark for crowd counting and lo- calization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.924161Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:e193d97d8ba1e8bfb360bf7ac2ba9d68f354cd9cd7c4e8c6efd2535914033089","observation_id":"276bb595-2037-4757-a1ea-05da2a137c85","resolution":{"observed_at":"2026-08-10T20:53:48.924161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.282205Z","title":"Eu- rosat: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":"34159237-5b8d-4b1b-b31c-a699867cadca","year":2019},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.929800Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:40eee75d114c0718e88e79313412ef09b14fa02e1e8abd08f62afd812adc3477","observation_id":"5cc974fa-04de-4841-94af-f937cc7041a8","resolution":{"observed_at":"2026-08-10T20:53:50.286416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.271914Z","title":"Rsvqa: Visual question answering for remote sensing data,","venue":null,"work_id":"0a6fd674-036b-48d0-8d78-3ca423244fd2","year":2020},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.934859Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:a4c944e636a7441512fabe32358fbe50675ec5342650db5dd997e803f2300697","observation_id":"f6f8f5c1-212f-41f0-bf55-3d951d630960","resolution":{"observed_at":"2026-08-10T20:53:50.275459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.06760","last_updated":"2017-02-22T11:37:49Z","snapshot_observed_at":"2026-08-14T21:15:20.831860Z","submitted_at":"2017-02-22T11:37:49Z","title":"Memory Matching Networks for Genomic Sequence Classification","version":1},"cited_work":{"arxiv_id":"1702.06760","doi":null,"metadata_source":"pith","pith_arxiv_id":"1702.06760","snapshot_observed_at":"2026-08-10T20:53:49.595780Z","title":"Memory Matching Networks for Genomic Sequence Classification","venue":"cs.LG","work_id":"6520edbd-2b6e-4124-aae8-c96e9cc8f2c4","year":2017},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.943707Z"},"links":{"cited_paper":"/paper/1702.06760","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:91aa80d439cc6bfa8d0598a9595cba7fe9479b620c43c7caf0bd50ec91c8c102","observation_id":"0b1b3e55-2252-4aa4-99c2-8052b752ed3e","resolution":{"observed_at":"2026-08-10T20:53:49.604414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.253262Z","title":"Unsupervised learning using pretrained cnn and associative memory bank,","venue":null,"work_id":"27ca776e-bcaf-499c-83c1-68343b428a26","year":2018},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.948787Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:d8a8edd10366279796cd8e97d1ce2dd96e91e53956fddd98790dd369cead8cf1","observation_id":"f9f2c85f-b234-4ac9-8f1e-f914575d4ec1","resolution":{"observed_at":"2026-08-10T20:53:50.256559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.242358Z","title":"Point cloud classi- fication via learnable memory bank,","venue":null,"work_id":"c80af2b5-6b73-4642-adc8-eeb0c6092b19","year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.952127Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:620ad21829ccc9fef039b84708967696f244fa8c9a9e0592c0083b8662eb8eb6","observation_id":"d64bc291-b7bb-4597-b758-eedc1136c231","resolution":{"observed_at":"2026-08-10T20:53:50.246020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.231111Z","title":"A new approach to automatic memory banking using trace-based address mining,","venue":null,"work_id":"56f70dbd-c5c3-46c8-96cb-d910c8445efd","year":2017},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.960698Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:973a5872e78409f88efd60b301aa654fc53d6a0ccfc8624bd75709e9e27f4d87","observation_id":"3e1a7e91-9290-4fcd-a985-29f759521b7d","resolution":{"observed_at":"2026-08-10T20:53:50.235618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.218878Z","title":"Visual anomaly detection via partition memory bank module and error estimation,","venue":null,"work_id":"608ea273-97cc-46b9-a951-93d5f2eea288","year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.040394Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:77222144ab903c5b25349c61964b296f9da66ac7bb43688df4536303e3e7715d","observation_id":"2c9ba90b-a9b2-406f-8d28-2c936e290849","resolution":{"observed_at":"2026-08-10T20:53:50.222736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.206808Z","title":"Mamba: Multi-level aggregation via memory bank for video ob- ject detection,","venue":null,"work_id":"403a011e-1521-4a05-811a-52252b6d220d","year":2021},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.134468Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:9bf626d9f8d567efa437cab6ee46f73e3bc94582d225f64e1affd1a0c0bd5479","observation_id":"ef5425ed-c87c-4bb3-ba1c-9a302af34009","resolution":{"observed_at":"2026-08-10T20:53:50.210886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.194338Z","title":"Semi-supervised se- mantic segmentation using unreliable pseudo-labels,","venue":null,"work_id":"ebebf1ab-5c90-410f-8f4f-b52bb94aa7a7","year":2022},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.138237Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:b4a311acc5c7811afba1ceea14bd7e273d48bfbefa7d6e8ad7e55a6441f906ba","observation_id":"5bfbfdac-8b31-4c20-8aca-15c4f3c3fc2a","resolution":{"observed_at":"2026-08-10T20:53:50.198699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.183704Z","title":"Weakly su- pervised semantic segmentation by pixel-to-prototype contrast,","venue":null,"work_id":"170381c5-10ee-4b88-884c-e91568b8a6bc","year":2022},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.142549Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:8da4a67c9b5b763b404d2b5677b3a46e57796e40e50e68a4e600483de3fa4242","observation_id":"415f4932-3d03-44c9-a949-187556a79f3b","resolution":{"observed_at":"2026-08-10T20:53:50.187358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:49.145828Z","title":"Memory-based cross-image con- texts for weakly supervised semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.145828Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:194618089407fca1168a2b3fe2893a4295b60e465e87e9cf5c06df25ec0ceacb","observation_id":"684a14ed-537d-4607-87aa-0a3b54aafca4","resolution":{"observed_at":"2026-08-10T20:53:49.145828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-10T20:53:49.150228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.150228Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:53518c2ec4e1777a7537736dccc9182cbe18a2357401e60aaa1a18260532ba2c","observation_id":"22fb036f-3f3b-49b7-9d3f-73c5c9f51bce","resolution":{"observed_at":"2026-08-10T20:53:49.150228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10115","last_updated":"2024-03-22T16:46:36Z","snapshot_observed_at":"2026-08-13T12:16:14.893703Z","submitted_at":"2023-12-15T09:57:21Z","title":"SkySense: A Multi-Modal Remote Sensing Foundation Model Towards Universal Interpretation for Earth Observation Imagery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10115","snapshot_observed_at":"2026-08-10T20:53:49.155213Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.155213Z"},"links":{"cited_paper":"/paper/2312.10115","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:458adea8b2765bbb9cfd8ebe4e0748b76abe1ae2f7ce8734428171b9d00a6c07","observation_id":"0c4f3726-bc66-403a-8186-5295f5245880","resolution":{"observed_at":"2026-08-10T20:53:49.155213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T20:53:49.159740Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.159740Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:13a779279db29a72b1be6791beb4c02434602fd1590e81f43f793d656f1c5d36","observation_id":"acc63c6e-dc1a-491c-9f95-9c707cdbb79b","resolution":{"observed_at":"2026-08-10T20:53:49.159740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.172828Z","title":null,"venue":null,"work_id":"6c6e5c4b-eaf6-4bc0-968f-c30fe9815f10","year":null},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.163538Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:3f1b5fb11dd072c7003309dea9d7441075b409abbfdda3edd9d4407878d1fbe8","observation_id":"fb343ad8-1d33-493f-939c-733a0419130b","resolution":{"observed_at":"2026-08-10T20:53:50.176587Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.161014Z","title":"Bleu: A method for automatic evaluation of machine translation,","venue":null,"work_id":"92e2703a-16b9-4bb2-a581-83fea8e5a771","year":2002},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.175607Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:412875bd0e83f18d6292d05035b0a11c7065c64c155652774e2c9e6b13ba6007","observation_id":"27cc5b5b-8844-4ab4-9905-14ce799e1e9c","resolution":{"observed_at":"2026-08-10T20:53:50.164726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:49.236877Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.236877Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:38310bbf8df03db95f51a360d0cfcbed388f9e91bdc2c984db5d2ee93f4e06bd","observation_id":"d9a9a7f3-0cd3-45c5-bb48-edcc708c2fcb","resolution":{"observed_at":"2026-08-10T20:53:49.236877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.144516Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":"7b59f8bf-4bf1-4dcc-8595-a53b22c93b3e","year":2005},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.345436Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:4809e3578e6be19dd85870610acd0d5eb9886c042d8650efd47d7c6e43ccd89b","observation_id":"2072881c-4e83-4d51-b916-1a177d2167bc","resolution":{"observed_at":"2026-08-10T20:53:50.148712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:49.349243Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.349243Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:0fc724ffeeb9bd89fc0193630d1c2921cedacd5927d93658909bf721996563f1","observation_id":"6b402188-5f59-45d8-b7e8-43466cc73e3f","resolution":{"observed_at":"2026-08-10T20:53:49.349243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12971","last_updated":"2023-10-19T17:59:01Z","snapshot_observed_at":"2026-08-13T21:11:20.544454Z","submitted_at":"2023-10-19T17:59:01Z","title":"CLAIR: Evaluating Image Captions with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12971","snapshot_observed_at":"2026-08-10T20:53:49.353753Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.353753Z"},"links":{"cited_paper":"/paper/2310.12971","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:dd1a0ad8a54143a5cb536d92b25273b911371a6c866fab91cea0aee7e48a49a2","observation_id":"e11a5396-91b5-45f2-a37e-e9b145a0dd63","resolution":{"observed_at":"2026-08-10T20:53:49.353753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:53:50.262855Z","title":"1109 / tgrs","venue":null,"work_id":"4c6d58ba-7dee-40ee-88cb-2df3061e5456","year":2020},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":644,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.939219Z"},"links":{"citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:b889129e40f48856698c7356a3f0040645b41e9879d19824702149a8756991f2","observation_id":"4d9b901b-18c8-4fb0-ad40-bd1ab864714a","resolution":{"observed_at":"2026-08-10T20:53:50.265991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T20:53:49.166936Z","title":"[Online]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:49.166936Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:889bac5ae04908b10463741544a5ece019de3fc1b35aacd2e9bd14045c417402","observation_id":"718daccd-d34f-4936-b586-5d5d9b13f84f","resolution":{"observed_at":"2026-08-10T20:53:49.166936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T13:54:43.023268Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":34,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 7 inbound Pith citation observations for arXiv:2501.06828."}