{"as_of":"2026-08-14T14:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e383c24f61a80daed8e2a8e8094b75d1907f80cca4ff96e3d47ed665e2b6b36b","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:15:40.738353Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:48:08.135538Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T14:10:29.694282Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"cited_work":{"arxiv_id":"2411.10857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10857","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Siripong et al","venue":null,"work_id":"cc7e1fec-efac-4ff4-a3b2-adb058bc0588","year":2024},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2411.10857","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:07f0dfee5948bfd815894d1ede2aeb68ba23ced27f04faab219eea885622436b","observation_id":"33874f6e-19a6-4391-9b4f-7190cae0c23c","resolution":{"observed_at":"2026-05-10T14:10:29.696030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.10857/citation-record","integrity":"/paper/2411.10857/integrity","json":"/paper/2411.10857/citation-record.json","paper":"/paper/2411.10857"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.532860Z","title":"Image Vis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.532860Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:0538120936296f3a6ffcb8d2faaa4659d84a69c5b5c9e8b6ef6a291dd2a692dd","observation_id":"1f3392d2-8c5e-4d7a-9216-57c5e9528e4c","resolution":{"observed_at":"2026-08-12T19:15:40.532860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.549580Z","title":"IEEE Trans","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.549580Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:2ca51060e2116b2ba3aed03a938c0d7c68026aacbf5b44c5be1b5cedae8ec63c","observation_id":"aa1d06bf-39d4-42ff-8b6a-2533e30cf3da","resolution":{"observed_at":"2026-08-12T19:15:40.549580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.554780Z","title":"In: IEEE International Geoscience and Remote Sensing Sympo sium, IGARSS 2021, Brussels, Belgium, July 11-16, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.554780Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:03468c1049fe75ca08edf1873f54feab89fb476d5645df18f73662890d14f186","observation_id":"9f41fd64-645b-4226-9a2f-1d1417f8b1d8","resolution":{"observed_at":"2026-08-12T19:15:40.554780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.561378Z","title":"In: Proceedings of the 60th Annual Meeting o f the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.561378Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:c850c1e07e29efe160292c1473abce23ab9c3873cd0a29cf7a5fdf2af5c68218","observation_id":"2f6f588b-75b9-42b3-849c-718a2fb473aa","resolution":{"observed_at":"2026-08-12T19:15:40.561378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:41.796897Z","title":"In: Proceedings of the ACM Web Conference 2022","venue":null,"work_id":"cc489c68-70d2-4606-bedb-cbff2ca4447f","year":2022},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.568150Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:e0ff947f3f2e644140ce482035d8cc9da771980985d3367ff231417396a30cf6","observation_id":"79babbff-615a-4a05-8ffc-24a05b2a3897","resolution":{"observed_at":"2026-08-12T19:15:41.801977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12961","last_updated":"2023-03-24T21:50:03Z","snapshot_observed_at":"2026-08-13T12:18:49.838767Z","submitted_at":"2023-03-22T23:54:14Z","title":"The Shaky Foundations of Clinical Foundation Models: A Survey of Large Language Models and Foundation Models for EMRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12961","snapshot_observed_at":"2026-08-12T19:15:40.580703Z","title":"CoRR abs/2303.12961 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.580703Z"},"links":{"cited_paper":"/paper/2303.12961","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:7c4612387fd8c947e4750d347641d80e15d4ddd6e189b96ddddf66b751476172","observation_id":"bb450e1c-19ad-475e-b533-85a8cc81287f","resolution":{"observed_at":"2026-08-12T19:15:40.580703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2404.11973","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:41.041098Z","title":"CoRR abs/2404.11973 (2024)","venue":null,"work_id":"8380e87d-5824-47d9-850c-9918ece36779","year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.587301Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:6fd3f1976e9bb51f3e8f8176d476adfa05ed3e42a8a42a17e57f6fab77e03050","observation_id":"a8854943-0f7d-4bf4-b2e4-acfc86110aea","resolution":{"observed_at":"2026-08-12T19:15:41.049351Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14656","last_updated":"2024-07-23T13:56:42Z","snapshot_observed_at":"2026-08-13T04:34:18.772084Z","submitted_at":"2024-01-26T05:33:34Z","title":"Scientific Large Language Models: A Survey on Biological & Chemical Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14656","snapshot_observed_at":"2026-08-12T19:15:40.593638Z","title":"CoRR abs/2401.14656 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.593638Z"},"links":{"cited_paper":"/paper/2401.14656","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:5988dc585ddc19786b792c4d5bd6bdb28580f6c3670c89412b08217d31df22ff","observation_id":"5056ddb1-806d-40c6-96cc-9887b5378102","resolution":{"observed_at":"2026-08-12T19:15:40.593638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.604157Z","title":"In : Proceedings of the AAAI Conference on Artiﬁcial Intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.604157Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:d8d5904ea38e414ea9af0dd640a10bbaba697a081f691fed24e71a572111f4d5","observation_id":"2a6883dd-c2bf-4ab9-b4e0-79153cecedd6","resolution":{"observed_at":"2026-08-12T19:15:40.604157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:41.754374Z","title":"In: Findings of the Associ ation for Computational Linguistics: ACL 2023","venue":null,"work_id":"f03719f3-3ab8-499e-9082-a2a9732dcdfa","year":2023},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.609190Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:99cd441f54efdda1a2e5b2e27218b0523c07ffee9900fd6f835b75ecd77843cd","observation_id":"d47662f8-eafb-4b9f-91ee-559e7f2c2c2e","resolution":{"observed_at":"2026-08-12T19:15:41.760225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.613313Z","title":"In: Pro- ceedings of the 2021 Conference of the North American Chapte r of the Associa- tion for Computational Linguistics: Human Language Techno logies","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.613313Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:6943d554435ac0865dc4965884662e6377bb6d8403646e77363acd141658354a","observation_id":"b70f8835-6ebe-4972-afea-8ef361897850","resolution":{"observed_at":"2026-08-12T19:15:40.613313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08734","last_updated":"2023-11-15T06:54:44Z","snapshot_observed_at":"2026-08-13T05:25:02.121156Z","submitted_at":"2023-11-15T06:54:44Z","title":"Thread of Thought Unraveling Chaotic Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08734","snapshot_observed_at":"2026-08-12T19:15:40.622649Z","title":"arXiv preprint arXiv :2311.08734 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.622649Z"},"links":{"cited_paper":"/paper/2311.08734","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:ba4fc0dffb116e7b52ec4418bdcef2fbcfcb585dee210191678b5dadd815799d","observation_id":"e409346d-9884-4a68-b64d-28ddc9eb0717","resolution":{"observed_at":"2026-08-12T19:15:40.622649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.634347Z","title":": Modeling event- pair relations in external knowledge graphs for script reas oning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.634347Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:6dc179e5f88fc640a90e9c965b194090e175d48c6766b739db24cc70fe71c97c","observation_id":"c2f31883-198e-4e9d-988b-9a195f0f0d4c","resolution":{"observed_at":"2026-08-12T19:15:40.634347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.646236Z","title":"In: Ku , L., Mar- tins, A., Srikumar, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.646236Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:cbb1ff7a4643b019e4bb3e7955903ef3b6c41e45a19cd5de579511b19c8a38ca","observation_id":"2cfb04ed-f8e3-477c-823d-48e2ea8a1c0a","resolution":{"observed_at":"2026-08-12T19:15:40.646236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.651845Z","title":"In: Proceedings of the 2023 4th Internationa l Symposium on Artiﬁ- cial Intelligence for Medicine Science, ISAIMS 2023, Cheng du, China, October 20- 22, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.651845Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:84db8cf60794e971039e256fe405b2c559f8bb03eff820fb0090454301264b7e","observation_id":"fee9ed2b-8be5-44ec-ad54-401352e5998f","resolution":{"observed_at":"2026-08-12T19:15:40.651845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10936","last_updated":"2025-01-07T12:15:01Z","snapshot_observed_at":"2026-08-14T14:41:44.057169Z","submitted_at":"2024-05-17T17:47:39Z","title":"A Survey on Large Language Models with Multilingualism: Recent Advances and New Frontiers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10936","snapshot_observed_at":"2026-08-12T19:15:40.657250Z","title":", Liu, J., Xu, Y., Xu, J., Nie, J., Liu, Y.: A survey on large lan- guage models with multilingualism: Recent advances and new frontiers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.657250Z"},"links":{"cited_paper":"/paper/2405.10936","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:e9eeed19bd6cb345f7bb345618fd1c159a26ffc502422fa233a4c0b113ab85a7","observation_id":"c2843fce-2d3e-478b-8e16-9ba930a03823","resolution":{"observed_at":"2026-08-12T19:15:40.657250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19732","last_updated":"2024-12-20T16:19:17Z","snapshot_observed_at":"2026-08-14T06:22:20.361501Z","submitted_at":"2024-10-25T17:59:09Z","title":"Rethinking Visual Dependency in Long-Context Reasoning for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19732","snapshot_observed_at":"2026-08-12T19:15:40.667858Z","title":"arXiv preprin t arXiv:2410.19732 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.667858Z"},"links":{"cited_paper":"/paper/2410.19732","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:69f9a78420c28261e619a486c1b6167de1c9d0f379bbb01bd1c154a2902321a1","observation_id":"898c11e7-d1e0-423c-96cf-3fb4862ba31f","resolution":{"observed_at":"2026-08-12T19:15:40.667858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.675712Z","title":"In: Findings of the Association for Comput ational Linguistics, ACL 2024, Bangkok, Thailand and virtual meeting, August 11- 16, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.675712Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:8eb224a743fcc5ec3fe39d7953839f8a83367ba5323ceeafc578adf347654825","observation_id":"64ae5d9e-acbe-491c-a025-616281d8b40a","resolution":{"observed_at":"2026-08-12T19:15:40.675712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:41.707722Z","title":"In: Companion of the 2024 International Conference on Management of Data","venue":null,"work_id":"e71d09b8-0c06-4726-9a5c-860978c0dcf7","year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.689724Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:a972e4ccd87fab0784ebee0d289e52e900533847ca3deef9d85f54f03b709c76","observation_id":"6516d9bc-92b3-4aee-8b43-283e518c8853","resolution":{"observed_at":"2026-08-12T19:15:41.712458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.696388Z","title":", Khan, F.S.: Geochat: Grounded large vision-language model for re mote sens- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.696388Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:57772ec088a8eeb960fe49087d0a31937a4c6ee2d3d2bb503e27bbb092e9378a","observation_id":"25393ad4-cf20-4bb0-a536-2d41c767c878","resolution":{"observed_at":"2026-08-12T19:15:40.696388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09712","last_updated":"2024-01-18T04:10:20Z","snapshot_observed_at":"2026-08-14T11:49:31.937716Z","submitted_at":"2024-01-18T04:10:20Z","title":"SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09712","snapshot_observed_at":"2026-08-12T19:15:40.701608Z","title":"L VLMs for Remote Sensing VQA 13 CoRR abs/2401.09712 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.701608Z"},"links":{"cited_paper":"/paper/2401.09712","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:31f59dee0ca1ce8daa732980169ed40cb48910de80468f5b3d420ca8641bd466","observation_id":"6efbb717-2a0f-41b5-8797-a665923bc8ce","resolution":{"observed_at":"2026-08-12T19:15:40.701608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:41.690280Z","title":"ISPRS Journal o f Photogrammetry and Remote Sensing 184, 116–130 (2022)","venue":null,"work_id":"ce301151-c05b-4f65-887f-94558836db3b","year":2022},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.707127Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:3015d751186b5db6a2ef0be6764fc1c2bc467fbd4a495a229671821e8b404011","observation_id":"d9c6ae98-6004-4442-9aac-9d0eb1d9b746","resolution":{"observed_at":"2026-08-12T19:15:41.696451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.712245Z","title":"IEEE Trans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.712245Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:ede5ebc449bf45e08bc81b37180b1b0d35761186175388359a68f91e7f64bb3c","observation_id":"8afd1e22-fd6d-4a20-99de-c81e714aba46","resolution":{"observed_at":"2026-08-12T19:15:40.712245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:40.716739Z","title":"In: Wooldridge, M.J., Dy, J.G., Natarajan, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.716739Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:f044cde028bdfc9ae1d8d840eb165bdc131ddd039ef7eb8e2902a05e5c873ffe","observation_id":"a27ae30b-cfbf-4f10-9095-b82b664b17a0","resolution":{"observed_at":"2026-08-12T19:15:40.716739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20213","last_updated":"2024-12-19T13:46:40Z","snapshot_observed_at":"2026-08-14T11:49:07.961909Z","submitted_at":"2024-03-29T14:50:43Z","title":"VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20213","snapshot_observed_at":"2026-08-12T19:15:40.721915Z","title":"C oRR abs/2403.20213 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.721915Z"},"links":{"cited_paper":"/paper/2403.20213","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:05171db1479879fd323508711a5f73a97a4e0f27d1a9b6ddd280fecc92a36d00","observation_id":"1b0766c5-dfac-4e36-8aae-06d285a67953","resolution":{"observed_at":"2026-08-12T19:15:40.721915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:15:41.659821Z","title":"In: The Twelfth International Conference o n Learning Repre- sentations, ICLR 2024, Vienna, Austria, May 7-11, 2024","venue":null,"work_id":"e70cd34e-c35e-4b59-8d9f-eae5e910104b","year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.727563Z"},"links":{"citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:9453a3496177fb8c05b24cb09ee75a4bfefef0555ec8acaebfa7c56918c1e0f1","observation_id":"52cade4b-717e-4235-9cd4-4840347e53bf","resolution":{"observed_at":"2026-08-12T19:15:41.668694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15266","last_updated":"2023-07-28T02:23:35Z","snapshot_observed_at":"2026-08-13T10:45:48.484753Z","submitted_at":"2023-07-28T02:23:35Z","title":"RSGPT: A Remote Sensing Vision Language Model and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15266","snapshot_observed_at":"2026-08-12T19:15:40.732785Z","title":"CoRR abs/2307.15266 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.732785Z"},"links":{"cited_paper":"/paper/2307.15266","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:00b384558bdaedfd9318d5d9bce89a4086cae44a83f156366ebfb29f509ed198","observation_id":"8f5e3d6f-4ffe-41f9-8388-d5f0bf429695","resolution":{"observed_at":"2026-08-12T19:15:40.732785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06475","last_updated":"2024-02-09T15:31:01Z","snapshot_observed_at":"2026-08-13T04:22:30.692524Z","submitted_at":"2024-02-09T15:31:01Z","title":"Large Language Models for Captioning and Retrieving Remote Sensing Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06475","snapshot_observed_at":"2026-08-12T19:15:40.738353Z","title":"CoRR abs/2402.06475 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:40.738353Z"},"links":{"cited_paper":"/paper/2402.06475","citing_paper":"/paper/2411.10857"},"observation_digest":"sha256:c267ef45d0acdcdfff3388f69eb35337a18b808db9e43a6e2cc4661423fa04e3","observation_id":"f13c5ab6-8c04-4339-9d0c-2056a4f7e859","resolution":{"observed_at":"2026-08-12T19:15:40.738353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.10857","last_updated":"2024-11-16T18:32:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T11:49:17.990180Z","submitted_at":"2024-11-16T18:32:38Z","title":"Large Vision-Language Models for Remote Sensing Visual Question Answering"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2411.10857."}