{"as_of":"2026-08-11T17:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4173c87886bd575d9ff515f85f61f22cda829af59f76cbd61f086a6021e4ae68","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T19:26:44.966467Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.10144/citation-record","integrity":"/paper/2501.10144/integrity","json":"/paper/2501.10144/citation-record.json","paper":"/paper/2501.10144"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.540750Z","title":"Canopy averaged chlorophyll content pre- diction using convolutional autoencoder on hyperspectral data,","venue":null,"work_id":"90e7fe10-a755-4d08-be3b-a19129f95b2e","year":2020},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.847841Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:65e6f191887000befb16a7d25e5b554b0c1dcda2a6f7e727119e30ae5e83060f","observation_id":"c1838a2c-9fe3-4eb5-bfcd-0e56e5146ecd","resolution":{"observed_at":"2026-08-10T19:26:45.545801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.526915Z","title":"Enhancing deforestation monitoring in the brazilian amazon: A semi-automatic approach leveraging uncer- tainty estimation,","venue":null,"work_id":"de6a0e7c-dbc7-4a1f-90b6-bb4a3b924507","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.852903Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:84fe57738334602d9caa96987e8c61d08b6eec68bd6eb68e1fdb31deff4f9a32","observation_id":"1694854d-5b7e-4220-8dee-6b573e39c490","resolution":{"observed_at":"2026-08-10T19:26:45.532352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.512714Z","title":"Sen1floods11: a georeferenced dataset to train and test deep learning flood algorithms for sentinel-1,","venue":null,"work_id":"b022a762-2baa-4471-88e1-29cfc0b90b89","year":2020},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.857234Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:0a101a572c95cff7f32925252a4e6716938c4481f0fa639c6c6275a69fe9d7d8","observation_id":"bc850173-9504-4c33-9c38-0a9ff8a53add","resolution":{"observed_at":"2026-08-10T19:26:45.517400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-10T19:26:44.861667Z","title":"Improved base- lines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.861667Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:951578128ff2bd3d265dcac578d80eb2b3f9272ba2c38d717ec9e6d18d4cff9e","observation_id":"dbe34249-0774-4a29-bdf4-dcb65b466d23","resolution":{"observed_at":"2026-08-10T19:26:44.861667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:44.866767Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.866767Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:3fa25924034749aa0caafc735e3a0967ef0c0cc42648b9f428f8bbc9ae37f589","observation_id":"4cf2e9f3-cdc3-4d4f-a818-d66cdceaaecd","resolution":{"observed_at":"2026-08-10T19:26:44.866767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:44.870831Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.870831Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:9e6ec82724a60fa340d3f2fd90e54e01f7ed9d93cb48ec2a1ef7cd2a63a383bb","observation_id":"4b4ef0d6-8697-41fc-9267-72625460c83d","resolution":{"observed_at":"2026-08-10T19:26:44.870831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:44.875200Z","title":"Blip- 3: A family of open large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.875200Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:b776f1864993de9d0b8934106954e8c8e1629b1b459c9bc3693f81b3a2872e23","observation_id":"eb33002a-ee4f-46f5-ad82-f8456ef1c552","resolution":{"observed_at":"2026-08-10T19:26:44.875200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.484166Z","title":"Geochat: Grounded large vision- language model for remote sensing,","venue":null,"work_id":"59f86005-bb3d-4c7a-97dd-0f9838cab0d6","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.879243Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:c0ede1206c30bad0340fb32c043341bd30acc979257c6dba525daed76f48c1d5","observation_id":"2af9673b-755f-4fd6-ba7a-cd1e8b138c42","resolution":{"observed_at":"2026-08-10T19:26:45.488360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.471625Z","title":"Geollava: Efficient vision-language models for temporal change detection in remote sensing,","venue":null,"work_id":"1dd79035-2cea-4715-ba6f-d0f7f95b0e7c","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.883227Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:ec16621b36ec8ebbd43d2fa81de8c6affab9b6029246df393a08436af8690388","observation_id":"e99ded90-b835-4b0e-adb9-5f79cfd646c5","resolution":{"observed_at":"2026-08-10T19:26:45.476126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-08-09T17:28:27.215326Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-10T19:26:44.887132Z","title":"Skysensegpt: A fine-grained instruction tuning dataset and model for remote sensing vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.887132Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:c211606a65a17123b66c8a20c14c0dd35e3def191266b855a9a255663e514a0e","observation_id":"ca4e9245-c9bb-4459-b843-cc1052393104","resolution":{"observed_at":"2026-08-10T19:26:44.887132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03653","last_updated":"2025-05-16T15:49:37Z","snapshot_observed_at":"2026-07-06T18:41:18.308899Z","submitted_at":"2024-07-04T05:48:28Z","title":"reBEN: Refined BigEarthNet Dataset for Remote Sensing Image Analysis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03653","snapshot_observed_at":"2026-08-10T19:26:44.891341Z","title":"reben: Refined bigearth- net dataset for remote sensing image analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.891341Z"},"links":{"cited_paper":"/paper/2407.03653","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:5b58bd19763f930ebc2bbe58ca60a4a55936cf975ab31083ba8804b8bf841de0","observation_id":"fd2f19f5-4f7e-45d9-8907-80706657e817","resolution":{"observed_at":"2026-08-10T19:26:44.891341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12134","last_updated":"2023-11-20T19:34:58Z","snapshot_observed_at":"2026-08-10T13:29:15.436760Z","submitted_at":"2023-11-20T19:34:58Z","title":"First principles residual resistivity using locally self-consistent multiple scattering method","version":1},"cited_work":{"arxiv_id":"2311.12134","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.12134","snapshot_observed_at":"2026-08-10T19:26:45.080890Z","title":"First principles residual resistivity using locally self-consistent multiple scattering method","venue":"cond-mat.mtrl-sci","work_id":"3addaa2f-7594-4f91-a1cc-ea9e3288c1ac","year":2023},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.895190Z"},"links":{"cited_paper":"/paper/2311.12134","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:7358001537477f12950f37d58bdfea3e7b2a755ba63a770b93f991258e9e8522","observation_id":"4863534a-e817-46a7-9594-825c2c60a759","resolution":{"observed_at":"2026-08-10T19:26:45.085727Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.459468Z","title":"Spectral reconstruction from satellite multispectral imagery using convolution and transformer joint network,","venue":null,"work_id":"3845bdf2-fd16-4a01-8943-7d50c0dee356","year":2023},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.899023Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:70dba7f3dd192c9fdf510201bcb04835edf21889d34891375b2a43047ceaccb2","observation_id":"58760e58-4351-44e1-a8ab-6582f79edd20","resolution":{"observed_at":"2026-08-10T19:26:45.463752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.447084Z","title":"Ringmo: A remote sensing foundation model with masked image modeling,","venue":null,"work_id":"59a06572-ce45-411b-932e-7f368070a1e0","year":2022},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.902304Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:df6e81b356cce59a25fbc00199833491cf81cc8aabe37b8b4a7838fabe47761c","observation_id":"061acac1-f5ce-41fb-b4cb-fef4bbe9b770","resolution":{"observed_at":"2026-08-10T19:26:45.451307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.434267Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":"44fdb73c-f7a3-4e22-be77-44ba5ae878f8","year":2022},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.906082Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:50ec9a24360874c2c1cb4fe0678b301cac078df4b54ac88a2d54394df4906383","observation_id":"2cbe90f8-8d2f-4d07-94e2-66cf27b0fd8a","resolution":{"observed_at":"2026-08-10T19:26:45.438591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01922","last_updated":"2025-04-07T21:54:56Z","snapshot_observed_at":"2026-08-10T17:49:10.571721Z","submitted_at":"2024-12-02T19:12:14Z","title":"Late-time Evolution and Instabilities of Tidal Disruption Disks","version":2},"cited_work":{"arxiv_id":"2412.01922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.01922","snapshot_observed_at":"2026-08-10T19:26:45.060020Z","title":"Late-time Evolution and Instabilities of Tidal Disruption Disks","venue":"astro-ph.HE","work_id":"7c6be218-d72c-492e-b76c-cce1753bd036","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.909901Z"},"links":{"cited_paper":"/paper/2412.01922","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:05dcc6aefdd829cc24c3ebf140969e6328e4580a91b872f46e09b43a6e8a1dae","observation_id":"bda0b774-b894-48e7-aaed-7e210aad771b","resolution":{"observed_at":"2026-08-10T19:26:45.067195Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.420559Z","title":"Spectralgpt: Spectral remote sensing foundation model,","venue":null,"work_id":"6e0ec9cc-f541-4f88-8d2c-6112fb4f98b2","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.913939Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:4fdf09727c4d7da3a44ad7bd669c2dad09dc7bc307a00048662b31be98927aca","observation_id":"41ff7c79-c082-4b5c-9f4e-158b0e998fa9","resolution":{"observed_at":"2026-08-10T19:26:45.425343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.408310Z","title":"Rsgpt: A remote sensing vision-language model and benchmark,","venue":null,"work_id":"f7950980-3575-4522-83de-63f40d68fe0f","year":2023},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.917729Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:18ead74f94917d4592b54f7ef7ab8457238a7c0862258794dddcd993fbab6bd4","observation_id":"21f93b25-e620-4a28-beb6-81179c3601da","resolution":{"observed_at":"2026-08-10T19:26:45.412442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.290597Z","title":"Earthmarker: A visual prompting multi-modal large language model for remote sensing,","venue":null,"work_id":"c7d9cc7f-e626-456e-94f8-b71daad8e362","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.921340Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:8c4f43e8ccd2820baeca4f4e8d39860e01926304ae1edaa2b83e8f915462c19e","observation_id":"1937ae6e-5625-4d8a-b76b-53a8f2514bc6","resolution":{"observed_at":"2026-08-10T19:26:45.400090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12345","last_updated":"2024-11-19T08:54:12Z","snapshot_observed_at":"2026-08-10T16:24:03.566604Z","submitted_at":"2024-11-19T08:54:12Z","title":"Combinatorics of generalized orthogonal polynomials of type $R_{II}$","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12345","snapshot_observed_at":"2026-08-10T19:26:44.925055Z","title":"Rs-moe: Mixture of experts for remote sensing image captioning and visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.925055Z"},"links":{"cited_paper":"/paper/2411.12345","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:dc3ff7c4d49117a5ded7207e6e20b9cf0818eec5053cf7dcdeadede95957d2ee","observation_id":"afed98c1-59ec-4a35-877e-4be148390dd5","resolution":{"observed_at":"2026-08-10T19:26:44.925055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09301","last_updated":"2024-11-14T09:23:40Z","snapshot_observed_at":"2026-07-06T19:50:15.546603Z","submitted_at":"2024-11-14T09:23:40Z","title":"LHRS-Bot-Nova: Improved Multimodal Large Language Model for Remote Sensing Vision-Language Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09301","snapshot_observed_at":"2026-08-10T19:26:44.930836Z","title":"Lhrs-bot-nova: Improved multimodal large language model for remote sensing vision-language in- terpretation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.930836Z"},"links":{"cited_paper":"/paper/2411.09301","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:15f4cbd6ffe7356f53a5a799e373d139fc72d80d04554686439cfd18d4d5027c","observation_id":"fb283d58-5694-487e-bbb6-c1bfaa93ed9c","resolution":{"observed_at":"2026-08-10T19:26:44.930836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11904","last_updated":"2025-05-10T15:43:29Z","snapshot_observed_at":"2026-08-09T10:21:28.477024Z","submitted_at":"2024-11-16T05:12:11Z","title":"GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11904","snapshot_observed_at":"2026-08-10T19:26:44.935014Z","title":"Geoground: A unified large vision-language model. for remote sensing visual grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.935014Z"},"links":{"cited_paper":"/paper/2411.11904","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:a1be6b7a24e6fda8d186627a340a0eee757bb79fc29642130a55e6c1355663c0","observation_id":"107ffc3c-f686-4b15-b1a2-65da33d38e76","resolution":{"observed_at":"2026-08-10T19:26:44.935014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.276444Z","title":"Skyeyegpt: Unifying remote sensing vision-language tasks via instruction tun- ing with large language model,","venue":null,"work_id":"15ed0b8d-a8a1-4ee0-8b00-d2b57d93a65e","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.939029Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:37430e20b6e74910aff331d94f4a836abbbbf2462273b4082d6c88fa34a73645","observation_id":"d72f046e-e008-4199-937e-5e13bb5abb3f","resolution":{"observed_at":"2026-08-10T19:26:45.281077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.262294Z","title":"Ringmogpt: A unified remote sensing foundation model for vision, language, and grounded tasks,","venue":null,"work_id":"9eb6d007-a130-4f4b-a5d4-66d6ccb283aa","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.942758Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:625aa24dcdafe00a01e9e88f2535a9eb9a9474476b58a1e459db79ecb71ca592","observation_id":"d51d1951-6a09-4315-942c-46bc30b80357","resolution":{"observed_at":"2026-08-10T19:26:45.266758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.248560Z","title":"Teochat: A vision-language assistant for earth observation data,","venue":null,"work_id":"57432277-7187-4fd2-98b3-74e91da8de64","year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.946669Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:19ab3ebfbfdc0685d012cdf36fee9a1ee52e101a39be20fb1201b11eabfec7c4","observation_id":"f2d47d54-df15-40e7-9b89-6f41eef3f49c","resolution":{"observed_at":"2026-08-10T19:26:45.252934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12345","last_updated":"2024-07-17T06:39:52Z","snapshot_observed_at":"2026-08-10T14:40:01.622558Z","submitted_at":"2024-07-17T06:39:52Z","title":"VisionTrap: Vision-Augmented Trajectory Prediction Guided by Textual Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12345","snapshot_observed_at":"2026-08-10T19:26:44.950567Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.950567Z"},"links":{"cited_paper":"/paper/2407.12345","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:63a8d832532119e8c2c0f2e83e0abd671bbd5692d7047b6dded83a47c145ac5d","observation_id":"b576194a-f80a-4478-a2ef-8059ee3c040e","resolution":{"observed_at":"2026-08-10T19:26:44.950567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.235391Z","title":"Functional map of the world,","venue":null,"work_id":"ad8b16f8-2ab5-42a8-a16e-eea6970ed599","year":2018},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.954718Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:bf708a14c15065198146b92a0060c95ddd0c979d1c08dbf8a63a022b7c7283d8","observation_id":"eeac5fb0-3a0c-4606-993f-0df4e692bf1e","resolution":{"observed_at":"2026-08-10T19:26:45.239515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.222466Z","title":"BigEarthNet: A large-scale benchmark archive for re- mote sensing image understanding,","venue":null,"work_id":"5969784f-156b-485c-a7f1-0d74b74168d8","year":2019},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.958497Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:b41e8a1ae440c852750b9d38c998ab3598c4fe9c4ac0fcf0353612c3e82a9b83","observation_id":"5901d53d-5e2b-4278-b5c2-7c087f02401d","resolution":{"observed_at":"2026-08-10T19:26:45.227417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12345","last_updated":"2025-06-17T20:37:32Z","snapshot_observed_at":"2026-08-06T10:45:08.715526Z","submitted_at":"2024-01-22T20:20:48Z","title":"Distributionally Robust Receive Combining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12345","snapshot_observed_at":"2026-08-10T19:26:44.962285Z","title":"Earthgpt: A universal multi-modal large language model for multi-sensor image comprehension in remote sensing domain,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.962285Z"},"links":{"cited_paper":"/paper/2401.12345","citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:d9be05f9d1b203e10bef2d0cd8ee6d73e412280cb89093e5ab78b3560f8b46a6","observation_id":"1d9f7c85-4c4c-4afb-8b45-e0d0ccc77b26","resolution":{"observed_at":"2026-08-10T19:26:44.962285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T19:26:45.210130Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":"890fa5fd-aae4-4f09-8186-431909aa431e","year":2019},"citing_paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T19:26:44.966467Z"},"links":{"citing_paper":"/paper/2501.10144"},"observation_digest":"sha256:1874dd0723b7b8e92b64b6b5636d5dd16fdaa602d6deb75603cd551551edc5c7","observation_id":"8df9fe71-2f7c-403c-83cb-3bf198841104","resolution":{"observed_at":"2026-08-10T19:26:45.214254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.10144","last_updated":"2025-01-17T12:12:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T19:21:17.993926Z","submitted_at":"2025-01-17T12:12:33Z","title":"A Vision-Language Framework for Multispectral Scene Representation Using Language-Grounded Features"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2501.10144."}