{"as_of":"2026-08-08T01:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2b0f48871d4b68db817d6b34f3e212acd53a8a888e3a6d4ff0750c4b4911801","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:22:41.831349Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:48:08.135538Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T14:10:29.814089Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"cited_work":{"arxiv_id":"2506.21863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21863","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Park et al","venue":null,"work_id":"f621d685-e23a-45c4-aa1d-86acae45783b","year":2025},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":148,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2506.21863","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:fe2ee60d45167931e2e57f2e8c287332c341ec35a3245c5034a0dc4c1dbd2db6","observation_id":"522cebc6-71b4-418f-9961-afaf5b036e74","resolution":{"observed_at":"2026-05-10T14:10:29.816125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21863/citation-record","integrity":"/paper/2506.21863/integrity","json":"/paper/2506.21863/citation-record.json","paper":"/paper/2506.21863"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T22:22:35.223058Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:35.223058Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:9e19e3a7822f82f73c290748519df6e3c8acd496d0fb02a8afb0c138c07aed1d","observation_id":"26b619e7-1fd1-4cff-a1b7-3a42e454f4de","resolution":{"observed_at":"2026-08-06T22:22:35.223058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:36.850304Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:36.850304Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:b8be067c59a0c6047b34dcd0a6aabf2b7c6066421192dfd80f01dc83cb7546e5","observation_id":"a367dd25-5608-4ce3-91e5-54c2a34bcb63","resolution":{"observed_at":"2026-08-06T22:22:36.850304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T22:22:36.905458Z","title":"Phi-3 technical report: A highly capable language model locally on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:36.905458Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:3d2c68ae6c4c8e383e6eb5491f8b991b3d539f7a9f69dadf2fa5ecff2dbc5eae","observation_id":"011fc25c-32c0-4045-9e49-0680ba162714","resolution":{"observed_at":"2026-08-06T22:22:36.905458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:36.997126Z","title":"Stanford alpaca: An instruction-following llama model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:36.997126Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:7cd3727619ef708d5f26c4bf017bfd9a9e98e910fae987cbf69046fc8d55d046","observation_id":"b9800eb2-efdb-4547-a677-6792b4e84941","resolution":{"observed_at":"2026-08-06T22:22:36.997126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:22:37.102606Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.102606Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:dd0d2920353f71d54b64e36cc2930c1dc0b239f5dad32440ef0d172a17340595","observation_id":"8ed410b6-ec2c-4dfe-9cb6-af69b0c31ba2","resolution":{"observed_at":"2026-08-06T22:22:37.102606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:37.201063Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.201063Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:3effad3cfa506543066aeac24340d6ede48eb7c95d6b40e334675446b500cb6f","observation_id":"ceffb3a3-2a06-46e5-8057-8f3c954513fc","resolution":{"observed_at":"2026-08-06T22:22:37.201063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:08.079336Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"76ef1582-c158-44e0-80e2-06ad60389669","year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.282011Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:9825af9ec1c1cc2a5633970cee85d8e4a1a2bdacdb291ca1f57bc8e18c6c0d19","observation_id":"0f3c7262-fc54-4fe3-9321-b2dd64f1f0d1","resolution":{"observed_at":"2026-08-06T22:23:08.137893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:07.969249Z","title":"Instructblip: towards general-purpose vision-language mod- els with instruction tuning,","venue":null,"work_id":"57468fd8-8108-485a-97ac-7bf28b0f84ba","year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.307798Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:1f1b2825992996f341583d6867b1ff1d06c435cdc8de972c071e2f935ac9a682","observation_id":"d7472608-b0c8-4bb4-97d0-3f532735ae94","resolution":{"observed_at":"2026-08-06T22:23:08.025541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:07.859629Z","title":"Visual instruction tuning,","venue":null,"work_id":"a1949a2b-8c27-4ff8-ae7f-0f996abcc1c3","year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.340244Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:3a5c1f0be56de021bfee01ff4fe72234f1c859ba4856d14d4649f2590190e5c3","observation_id":"be8d938d-911a-477e-be1d-78920bae6ad8","resolution":{"observed_at":"2026-08-06T22:23:07.904765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:37.379971Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.379971Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:ca5856137ec2b721acc8b92125aae41b00edbd7873cd6574c11f480110dba1f8","observation_id":"35dd2474-e173-4e13-abf0-5519d5d892b4","resolution":{"observed_at":"2026-08-06T22:22:37.379971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:37.425036Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.425036Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:7bec9da333aab33bf9ad4af0b58f63944ce835ec8165c6c6be5817d5dbfa5bef","observation_id":"ba83cc8c-8833-4ca0-8872-f73e3468f0f7","resolution":{"observed_at":"2026-08-06T22:22:37.425036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:37.458153Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.458153Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:4f33d0f97cd3c64683b1f9e4643cb0f4f6f2b044aac32e49b5a97d4d06cd51c5","observation_id":"bbf9b0fa-3c69-4555-ab15-6338cf0f33ae","resolution":{"observed_at":"2026-08-06T22:22:37.458153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:37.512451Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.512451Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:fd0f693aed050d7d08854352fda30bcdf0fe466d09977d4b3b5fb164fe7553ad","observation_id":"fa6b6200-8df9-4657-bc92-5e9670131043","resolution":{"observed_at":"2026-08-06T22:22:37.512451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:07.686758Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites,","venue":null,"work_id":"4d8ea473-212f-407c-a62a-d6a348d549cc","year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.555854Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:d893466250f66d6053aa333f756dc67e4aa9cae68effab40e82873da20e271a8","observation_id":"dd754c83-1607-4e06-badf-284d63151ec8","resolution":{"observed_at":"2026-08-06T22:23:07.740051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T22:22:37.581702Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.581702Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:65a0ef174648b2937e3cded1b4a910b91213de9283a1a28ebe00e0c66ab8deb6","observation_id":"f94173a1-c875-42c0-b7a9-a514fe7be0c8","resolution":{"observed_at":"2026-08-06T22:22:37.581702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T22:22:37.620896Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.620896Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:b11433ec19392c599c361dc602f958c9f04c3b227e1b964b84c191d727b1ec2b","observation_id":"3b8029ff-bebd-4799-878e-2bc272449bc2","resolution":{"observed_at":"2026-08-06T22:22:37.620896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T22:22:37.650879Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.650879Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:07cd08df3496444329dbb438e0d75905d5362df8f7ce50f4bc6c396097d88e1e","observation_id":"38cd8281-1b22-4352-8eff-46b7aecea09b","resolution":{"observed_at":"2026-08-06T22:22:37.650879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:07.560802Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks,","venue":null,"work_id":"4adec50d-24e8-450f-9d9c-543970e6f3e3","year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.685120Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:ee8ca5768038b473ee3d55378a002d570c04f3a10097bf924ec21bfa3ee7029b","observation_id":"6a00b048-1af5-49e0-a168-9ac0d95eebb4","resolution":{"observed_at":"2026-08-06T22:23:07.626489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T22:22:37.709672Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.709672Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:717aa90e3d83e85cd4481abfc88d4e475f5440a11db487c923ccab0418f66556","observation_id":"006f5fa3-1fc7-4cbe-9933-4fa979b7adf1","resolution":{"observed_at":"2026-08-06T22:22:37.709672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:07.313236Z","title":"Learning source-invariant deep hashing convolutional neural networks for cross-source remote sensing image retrieval,","venue":null,"work_id":"2c482ec1-8474-4cf2-886a-9ca4eb772c40","year":2018},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.735468Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:5f8d2463c26a6c98cd6d9adb51166523b98f0cf530028c39fb399518a24c2d55","observation_id":"f6a5387e-36b4-4fbd-b673-82fb7b301473","resolution":{"observed_at":"2026-08-06T22:23:07.384742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:07.148758Z","title":"Automatic radiometric normalization for multitemporal remote sensing imagery with iterative slow feature anal- 12 ysis,","venue":null,"work_id":"661af90d-7079-4c90-9998-7abbf9ae925f","year":2014},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.759575Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:821af270175106e853fadfa864d8cb40a792edd8e6c00166b2c6b58aec084661","observation_id":"4825f794-4740-45eb-b570-3a66cf21449b","resolution":{"observed_at":"2026-08-06T22:23:07.237268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:06.957190Z","title":"A supervised progressive growing generative adversarial network for remote sensing image scene classification,","venue":null,"work_id":"53a8b0ed-7847-4d52-b3e6-b65d08937115","year":2022},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.795105Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:a41f72522ea25623d177075997d911db213c1f4c89573006fd96ab3cc324404e","observation_id":"8cd2adb0-69d2-4b66-90b4-5bf616d57c2b","resolution":{"observed_at":"2026-08-06T22:23:07.054740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:06.826029Z","title":"Multimodal remote sensing image matching combining learning features and delaunay triangula- tion,","venue":null,"work_id":"5abe7bbf-552a-477b-9891-30eeea611719","year":2022},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.825702Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:b355ebfaa177ec33b885cb57e6cc83a34f2a937ca1122cf264ce66b4980a0e3e","observation_id":"b237e4cc-abc1-4e2d-bcec-3e145eadc888","resolution":{"observed_at":"2026-08-06T22:23:06.906216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:06.594294Z","title":"Urban flood-related remote sensing: research trends, gaps and opportunities,","venue":null,"work_id":"99376b14-a387-43ed-87d5-f535b204b059","year":2022},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.864695Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:688b59d32ddd132b2d49dab24ac836aeeba0e7bbd7b779dee763a7b7847705c4","observation_id":"aa33687a-f580-4333-97d4-2a08a59da360","resolution":{"observed_at":"2026-08-06T22:23:06.680198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:06.528145Z","title":"Remote sensing-based proxies for urban disaster risk management and resilience: A review,","venue":null,"work_id":"3d0dd794-9933-4954-bceb-4f4066d0ab6b","year":2018},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.917813Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:38680c2ff37bea81264ea7cac10b3389e8655a104a528427d4705ab6e4bf0303","observation_id":"107a23c2-1ed6-4912-8df3-21a2d23c0e9e","resolution":{"observed_at":"2026-08-06T22:23:06.535824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:06.413671Z","title":"Remote sensing in multirisk assess- ment: Improving disaster preparedness,","venue":null,"work_id":"7004c779-4623-46a5-9aeb-e19b0316acbf","year":2017},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.951695Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:3d7ab28699f0e8705f2be0e7770e9e32019de15054378aea828a48d930b00b2f","observation_id":"091bfab1-7671-4e9d-a78a-12980f751795","resolution":{"observed_at":"2026-08-06T22:23:06.468657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:06.305620Z","title":"Geochat: Grounded large vision-language model for remote sensing,","venue":null,"work_id":"cc556c3a-f853-47e2-b0e1-b9bf0df9962c","year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.992766Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:89956fb9260e66208971d3d13e2e5768b2814309a3c7a879484c1f2dbc9f177e","observation_id":"48d1a99b-3fff-4879-86fb-83e40371dc0c","resolution":{"observed_at":"2026-08-06T22:23:06.359877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:06.155276Z","title":"Lhrs-bot: Empowering remote sensing with vgi-enhanced large multimodal language model,","venue":null,"work_id":"dc00de65-8acb-4b4c-95f4-518b4d8454b0","year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.024677Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:4ed2f445c532f4a9e80420255516d73c179749dde7ed36a4acc96ac007fcc130","observation_id":"bf95f217-69ae-4b4d-8275-716b44b4473f","resolution":{"observed_at":"2026-08-06T22:23:06.234735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:05.877751Z","title":"Skyeyegpt: Unifying remote sensing vision-language tasks via instruction tuning with large language model,","venue":null,"work_id":"a6ec586b-aa9d-459c-b627-c1d9e0b2f0ac","year":2025},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.095736Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:6fa5f8f44e6cb32f256562c5ba251677316536efe6c63d82d7f00f521b4b66d5","observation_id":"8ed055c6-7b5c-4429-ae66-7caf29855f62","resolution":{"observed_at":"2026-08-06T22:23:06.061858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:04.939286Z","title":"H2rsvlm: Towards helpful and honest remote sensing large vision language model,","venue":null,"work_id":"24df630b-be19-4db3-99b9-a048c8de7e21","year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.155117Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:2a03bdd05f1d7b6e2330d21de08a8f872a157844552202a54fd22e257c9d0ba0","observation_id":"1790d3fa-4750-40bd-8f65-f765a54d9134","resolution":{"observed_at":"2026-08-06T22:23:05.609068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:38.225898Z","title":"Rs- llava: A large vision-language model for joint captioning and question answering in remote sensing imagery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.225898Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:3bf51169ca224a02778ddca9c7c9be3ef02c577e68879d2516011fe6ae10dedf","observation_id":"aec9247a-2ce7-4106-ba4c-d5a89bbc388e","resolution":{"observed_at":"2026-08-06T22:22:38.225898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-07-06T18:31:04.425917Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-06T22:22:38.288515Z","title":"Skysensegpt: A fine-grained instruction tuning dataset and model for remote sensing vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.288515Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:a8b72ec16ce1be43cfeb485c3a1411824e9e874bad82abe6de9e442280fd51a7","observation_id":"f16d1259-155d-4449-8054-a9a99b154a5a","resolution":{"observed_at":"2026-08-06T22:22:38.288515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:38.369262Z","title":"Rsgpt: A remote sensing vision language model and benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.369262Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:08e3e2def66f6989299ab410cf72d4c77497b082764ee8f1f7469e1686f5bba3","observation_id":"0f5c73c2-eed5-4256-95f8-765f8e89c25f","resolution":{"observed_at":"2026-08-06T22:22:38.369262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05679","last_updated":"2024-12-10T02:23:30Z","snapshot_observed_at":"2026-07-06T20:03:16.082369Z","submitted_at":"2024-12-07T15:11:21Z","title":"RSUniVLM: A Unified Vision Language Model for Remote Sensing via Granularity-oriented Mixture of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05679","snapshot_observed_at":"2026-08-06T22:22:38.461173Z","title":"Rsunivlm: A unified vision language model for remote sensing via granularity-oriented mixture of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.461173Z"},"links":{"cited_paper":"/paper/2412.05679","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:b0f2af68a8ef3e927aae496e3a107622254d0bc6e6009c4c3d5259fdbf309cff","observation_id":"f83e90f2-a829-40bc-b0ea-8b0f4cb61f5f","resolution":{"observed_at":"2026-08-06T22:22:38.461173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T22:22:38.535644Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.535644Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:2ceb76141902245e1eda5c6b771d3b2a8eaae1c189fa4bc0e597cc2ab38b440a","observation_id":"ec569c52-8643-4cc7-83d8-c0bd36107b6f","resolution":{"observed_at":"2026-08-06T22:22:38.535644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:22:38.617226Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.617226Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:a8213e9b92449fb672192a115bba0b9b52a13a562b658c8387103e61268ee718","observation_id":"bb233f38-f6ac-42d0-844a-370aa015a0e8","resolution":{"observed_at":"2026-08-06T22:22:38.617226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T22:22:38.685861Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.685861Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:2064e52efeb3b465e00c02498a1e1e03f5d898a1308049fd344249454ccb80c2","observation_id":"77549bf0-b983-43f4-84e4-b843211d9a8e","resolution":{"observed_at":"2026-08-06T22:22:38.685861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:38.777895Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.777895Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:765bf07d1d4c0fa4b23a6881afcac8987f5621fb769e9d1cbfe507667ed3841d","observation_id":"b20196fd-9769-4162-830a-65bd6f5a89c8","resolution":{"observed_at":"2026-08-06T22:22:38.777895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:38.870626Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.870626Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:7244c296c274c6af503f31996dc5b1f660fdaf775ad7b0831fa58768676b97e0","observation_id":"253ce06b-4d3e-4d1b-bb05-902024b5477d","resolution":{"observed_at":"2026-08-06T22:22:38.870626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T22:22:38.978885Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.978885Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:a81a33ceafe767d5bae6bd58c52aebf6c91195a88126ffde543c20b0a07c5208","observation_id":"d9dcd1a2-1e1c-42ab-934b-5e83343b41f0","resolution":{"observed_at":"2026-08-06T22:22:38.978885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T22:22:39.049798Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.049798Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:df93eb926a42d0c81eb1cca69b4b642b82e53842caf69d6d8bffc8346601a421","observation_id":"e4d4b9f3-1b07-4cb6-b2d9-5521e39fca66","resolution":{"observed_at":"2026-08-06T22:22:39.049798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-06T22:22:39.123538Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.123538Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:1a5b156825b62ae6856f08e3a880cb7484ac6ecafb08e30691996639bec8103f","observation_id":"2a7d4b5d-d066-4e70-bbd3-4208638aae9f","resolution":{"observed_at":"2026-08-06T22:22:39.123538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T22:22:39.212756Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.212756Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:92ffb32fadc8c080276511f67ba773a2d5042ac811a28a0451084c105c44beee","observation_id":"a62c908d-af4f-4995-9b14-dc0f73021938","resolution":{"observed_at":"2026-08-06T22:22:39.212756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-02T15:31:34.622625Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-06T22:22:39.299853Z","title":"Kosmos-2.5: A multimodal literate model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.299853Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:d1d2bd02836bf69c08d01a2651eab429bc47aa8d7b1ea063a4e339ccd2c6b418","observation_id":"e759238f-dab3-4c82-8923-2bcb3f9e021a","resolution":{"observed_at":"2026-08-06T22:22:39.299853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:39.393855Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.393855Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:693115eecc4959f83844a8f5315d9428c0a607d7032b32c954bea1c5998e2765","observation_id":"ff274aec-2bf1-4ed8-8007-f2c30dc020d1","resolution":{"observed_at":"2026-08-06T22:22:39.393855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:03.574489Z","title":"Sharegpt4v: Improving large multi-modal models with better captions,","venue":null,"work_id":"099a3744-25cd-4d2b-a35f-8d5d57028830","year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.491263Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:d60336f0b207fef4ee08a2cde351f58435f6a25090f86a9757a72b3f4185140d","observation_id":"ef79ffac-a7ca-4ea5-9e95-168cee76a890","resolution":{"observed_at":"2026-08-06T22:23:03.827568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T22:22:39.583072Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.583072Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:2f508116d81542538c5c014bd33f1dc61b6e3347d765112588b8fff7b21ddabe","observation_id":"e83556a7-25f4-4a34-845c-d81d4b8bfba9","resolution":{"observed_at":"2026-08-06T22:22:39.583072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-06T22:22:39.652994Z","title":"Internlm-xcomposer: A vision- language large model for advanced text-image comprehension and composition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.652994Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:263ff36671b828bff350c8419a3ad81811cb4f0d01fcbfca7a3c0eb6da9c2216","observation_id":"6634d2c4-535b-4d8f-889a-8032b1f00373","resolution":{"observed_at":"2026-08-06T22:22:39.652994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:03.515053Z","title":"Gpt4roi: Instruction tuning large language model on regionof-interest, 2024,","venue":null,"work_id":"73a36d4f-27ed-434c-bc8d-7125c7f29c60","year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.761352Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:65ba960c2a8c9690e5381d457d9d48f9c2f3c12d870c86d6ffed4e382cea1c7c","observation_id":"b281da44-fbdf-4dc3-9560-9aa1687ef19c","resolution":{"observed_at":"2026-08-06T22:23:03.548855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:39.844011Z","title":"Glamm: Pixel grounding large multimodal model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.844011Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:f8dc4be1834250af6a62a319e2e09127df9a6df51f903f001fcd06760ea5ef38","observation_id":"0409c39d-37a3-487d-9e11-a04f0cd333e9","resolution":{"observed_at":"2026-08-06T22:22:39.844011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09301","last_updated":"2024-11-14T09:23:40Z","snapshot_observed_at":"2026-07-06T19:50:15.546603Z","submitted_at":"2024-11-14T09:23:40Z","title":"LHRS-Bot-Nova: Improved Multimodal Large Language Model for Remote Sensing Vision-Language Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09301","snapshot_observed_at":"2026-08-06T22:22:39.933256Z","title":"Lhrs- bot-nova: Improved multimodal large language model for remote sensing vision-language interpretation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.933256Z"},"links":{"cited_paper":"/paper/2411.09301","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:2ce22ec7497a2542d87d5bcfa6e1bf8a660e47817604c169ec9f53f1cc8ee12b","observation_id":"d4964b9e-ef44-4714-bbbb-b500462ca1fb","resolution":{"observed_at":"2026-08-06T22:22:39.933256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13596","last_updated":"2024-11-29T10:18:58Z","snapshot_observed_at":"2026-07-06T18:48:33.555151Z","submitted_at":"2024-07-18T15:35:00Z","title":"EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13596","snapshot_observed_at":"2026-08-06T22:22:40.050681Z","title":"Earth- marker: Visual prompt learning for region-level and point-level remote sensing imagery comprehension,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:40.050681Z"},"links":{"cited_paper":"/paper/2407.13596","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:149a0639a1b87999d0259f26187c5a87b47d9831a3d23c3b008856992af5b549","observation_id":"e5b11529-a876-47bc-afe7-58fcfbb95c0d","resolution":{"observed_at":"2026-08-06T22:22:40.050681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19552","last_updated":"2025-05-21T19:12:41Z","snapshot_observed_at":"2026-07-06T19:39:42.675941Z","submitted_at":"2024-10-25T13:26:32Z","title":"GeoLLaVA: Efficient Fine-Tuned Vision-Language Models for Temporal Change Detection in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19552","snapshot_observed_at":"2026-08-06T22:22:40.114061Z","title":"Geollava: Efficient fine-tuned vision-language models for temporal change detection in remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:40.114061Z"},"links":{"cited_paper":"/paper/2410.19552","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:bca84105674533c402720bde4a0d655bd5c26486b509ef38ca02f2d03b471aea","observation_id":"cddd690e-fa14-49b9-a2bc-321b147da3a4","resolution":{"observed_at":"2026-08-06T22:22:40.114061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06234","last_updated":"2025-01-27T01:45:15Z","snapshot_observed_at":"2026-07-06T19:29:55.838200Z","submitted_at":"2024-10-08T17:45:51Z","title":"TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06234","snapshot_observed_at":"2026-08-06T22:22:40.225645Z","title":"Teochat: A large vision-language assistant for temporal earth observation data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:40.225645Z"},"links":{"cited_paper":"/paper/2410.06234","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:f4517bae5a2c2c459badfd773cc06b9b920b45428ccc28ec064799fa36777a59","observation_id":"b837ee10-fd68-4969-a7c7-5ae3e609ebc5","resolution":{"observed_at":"2026-08-06T22:22:40.225645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:23:03.308257Z","title":"Earthgpt: A universal multi-modal large language model for multi-sensor image comprehension in remote sensing domain,","venue":null,"work_id":"dea7529d-b1dd-45b5-a6c7-653920be4b72","year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:40.319247Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:b7b28d04dc540c1ff674b9fd4f737c4bfc629617f033afe4106a1c28f89be0b3","observation_id":"ee836c34-910a-4761-b513-d54b9060d421","resolution":{"observed_at":"2026-08-06T22:23:03.371380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:45.650068Z","title":"Ringmogpt: A unified remote sensing foundation model for vision, language, and grounded tasks,","venue":null,"work_id":"99c5e311-739b-4213-958b-99c9937f6ad9","year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:40.405051Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:186ac030217fb117c0ab114245105946abffdf3c3b19a7b0993a30179bc45146","observation_id":"76d8790e-b373-4c74-a4c0-9e8653b0605b","resolution":{"observed_at":"2026-08-06T22:23:03.204907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:40.494200Z","title":"Skyscript: A large and semantically diverse vision-language dataset for remote sens- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:40.494200Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:2edc55594a64ce44ba28ae655da1520b5e715953134a9fabc562b2d007948826","observation_id":"1e2553fc-aa01-4bcf-9126-187abe71100c","resolution":{"observed_at":"2026-08-06T22:22:40.494200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:44.865831Z","title":"Deep semantic understanding of high resolution remote sensing image,","venue":null,"work_id":"230e94d0-1316-451b-b0bb-a8cd9314dffc","year":2016},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:40.564185Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:0032bbb891e903b8a96cbb5560b5a93c8f6e324e61615ab9ec65a11e9bb226d4","observation_id":"f30ee937-9a04-41b4-b979-557da59ec5a0","resolution":{"observed_at":"2026-08-06T22:22:45.081454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:40.639987Z","title":"Remote sensing image scene classifi- cation: Benchmark and state of the art,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:40.639987Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:ac3acb3c3a4bb3f6cc22cf13e2fb848c354d4fecb5bba28995805a282e0438e0","observation_id":"9e93813d-4eaa-4ec6-8557-c15fbd3fc5cf","resolution":{"observed_at":"2026-08-06T22:22:40.639987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:44.602201Z","title":"Nwpu- captions dataset and mlca-net for remote sensing image captioning,","venue":null,"work_id":"21e9f33c-3d2b-439f-ae50-f92bc32c44ca","year":2022},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:40.714308Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:e07afd24bf933df407e648fb13bc712dea5866f40686958b43d93010f48c007c","observation_id":"1b3dcfdb-32b9-4c65-a9d6-911c92551ff7","resolution":{"observed_at":"2026-08-06T22:22:44.694995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09868","last_updated":"2022-04-21T03:53:19Z","snapshot_observed_at":"2026-08-05T04:18:21.689354Z","submitted_at":"2022-04-21T03:53:19Z","title":"Exploring a Fine-Grained Multiscale Method for Cross-Modal Remote Sensing Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09868","snapshot_observed_at":"2026-08-06T22:22:40.798399Z","title":"Exploring a fine-grained multiscale method for cross-modal remote sensing image retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:40.798399Z"},"links":{"cited_paper":"/paper/2204.09868","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:8a404b82f2e11680f183c8ffb0649b9d1402e55d6a4cc80bda02a260a316d71e","observation_id":"4911cca2-b81f-45e1-9d61-c6f362d666ac","resolution":{"observed_at":"2026-08-06T22:22:40.798399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11166","last_updated":"2022-08-15T04:37:26Z","snapshot_observed_at":"2026-07-06T13:34:17.317584Z","submitted_at":"2022-07-22T16:12:07Z","title":"METER-ML: A Multi-Sensor Earth Observation Benchmark for Automated Methane Source Mapping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.11166","snapshot_observed_at":"2026-08-06T22:22:40.908652Z","title":"Meter-ml: a multi-sensor earth observation benchmark for automated methane source mapping,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:40.908652Z"},"links":{"cited_paper":"/paper/2207.11166","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:b9059378e7ca03f4881117c63230483ec6be200b8e0a511dfb3145dfaaf2be44","observation_id":"51d48c8a-48b8-4d32-99bb-97de27ae9e6e","resolution":{"observed_at":"2026-08-06T22:22:40.908652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.031030Z","title":"Functional map of the world,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.031030Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:a195131a322563488e9c0287b5565cae8393023c70944a76d2097b7d168e94f7","observation_id":"bca7d714-1582-4d43-bce5-a7e9262d9514","resolution":{"observed_at":"2026-08-06T22:22:41.031030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:44.315189Z","title":"Exploring models and data for remote sensing image caption generation,","venue":null,"work_id":"0ed93e53-6346-40a8-ab07-1a5215ce8912","year":2017},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.078684Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:1dff682d517f217a408ae9e0f23abdac39f39250d68cc904fb78fd081da56ac2","observation_id":"a2dcb4e5-4bc9-4eb3-a623-418848a1c8e2","resolution":{"observed_at":"2026-08-06T22:22:44.460150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:44.038638Z","title":"Rsvqa: Visual question answering for remote sensing data,","venue":null,"work_id":"a9ed8694-171b-49db-89ed-7c217646c72f","year":2020},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.132016Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:eb154c30e2091440daea84293169fce606bea85c0c098a3481c90fb7ccc0582d","observation_id":"ff9def5d-e6e7-4689-9bc6-520ecde441ec","resolution":{"observed_at":"2026-08-06T22:22:44.146974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:43.758867Z","title":"Visual grounding in remote sensing images,","venue":null,"work_id":"b90af070-4d88-4887-92ef-5755f3ffd9ca","year":2022},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.183387Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:239cfaa0e30d456da50b32e360b1befea74b591f38b6c1f93d6bf343db6ce083","observation_id":"e0692b84-d5bb-411a-8ae5-72431ce9f3c4","resolution":{"observed_at":"2026-08-06T22:22:43.880645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:43.451367Z","title":"Rsvg: Exploring data and models for visual grounding on remote sensing data,","venue":null,"work_id":"52130212-d664-4f65-9cca-97566e0d2478","year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.237485Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:853bcefe549dc1c71470ef6021657fd5fc7c80f13e6501f3f3cee5969f90c1dc","observation_id":"ad0bd306-6f06-44b9-a4c6-77ded1d15432","resolution":{"observed_at":"2026-08-06T22:22:43.585787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.294447Z","title":"Object detection in optical remote sensing images: A survey and a new benchmark,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.294447Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:aeef4099880f85ff7c39c32a9686e88091754c2b8800827f0a208440f79fefbd","observation_id":"0ace819e-8c81-45a1-8691-900ac20deb2a","resolution":{"observed_at":"2026-08-06T22:22:41.294447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.350812Z","title":"Dota: A large-scale dataset for object detection in aerial images,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.350812Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:22dc8a1ce8b0e4c625bd088db872df8878c8198a9632f14f953e87c6a86f6ef4","observation_id":"74381c94-fca9-478f-8ce9-fefc3ea57b87","resolution":{"observed_at":"2026-08-06T22:22:41.350812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:43.115457Z","title":"Aid: A benchmark data set for performance evaluation of aerial scene classification,","venue":null,"work_id":"281d910b-2ffd-4174-ab22-26ada2c75f70","year":2017},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.398190Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:a34a6f4e5fbc98e845a07f9ad1e09ced754b247b278a187185052b0ecaebdb5b","observation_id":"d5a745c7-c55c-4c8a-8348-2d69ffe7ae2b","resolution":{"observed_at":"2026-08-06T22:22:43.248276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:42.882571Z","title":"Satellite image classification via two-layer sparse coding with biased image representation,","venue":null,"work_id":"077738c3-c921-41a3-9ac6-ea57c3b2c625","year":2010},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.467391Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:cda529f21f355a022470110aa71f011bca8ab61bfb537e6864d8323a2b339980","observation_id":"f0ac9d96-da54-4527-9b83-f21b3531fddd","resolution":{"observed_at":"2026-08-06T22:22:43.002910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:42.677658Z","title":"Bag-of-visual- words scene classifier with local and global features for high spatial resolution remote sensing imagery,","venue":null,"work_id":"4ac5e65b-a405-4b45-8e9e-53ed2d1bd2b0","year":2016},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.529916Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:524ad3199ceb64fec24623ee4000cc2ecb1d1a7deba684b451e1d97f7555ed4f","observation_id":"16b87da5-b324-4c2a-aa0a-a7711128364f","resolution":{"observed_at":"2026-08-06T22:22:42.750777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.583771Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.583771Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:2f2fd911544d2d96951711ceb817f2500f992e52a608ed0e3836513bf9811467","observation_id":"7c171966-67c3-453a-8619-10b7c97a4124","resolution":{"observed_at":"2026-08-06T22:22:41.583771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T22:22:41.662531Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.662531Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:4656574b4a2a90ca5397a5af63a512cd3be8c1b7c382900bf9cf9e4bce08527e","observation_id":"ab0645a4-d411-4393-a611-ed09529fa31e","resolution":{"observed_at":"2026-08-06T22:22:41.662531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T22:22:41.716132Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.716132Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:1a205c5c4da9966ce9e024956f86ae29ead1cc4939dbfd221ef3d73537c6512b","observation_id":"b3dcb610-4927-4266-88be-ce3d69c6f970","resolution":{"observed_at":"2026-08-06T22:22:41.716132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:41.767782Z","title":"Qwen2.5: A party of foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.767782Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:9e565fb5e7bfae9c4eed6d0b058e7b285be0b96f4bfe0a783c2e11f6d4446735","observation_id":"f5c432bd-ec86-4cd4-8ee2-4da9858061f4","resolution":{"observed_at":"2026-08-06T22:22:41.767782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:22:42.520539Z","title":"Vhm: Versatile and honest vision language model for remote sensing image analysis,","venue":null,"work_id":"593cf687-f625-4985-bbf3-3230bb2c0904","year":2025},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:41.831349Z"},"links":{"citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:d102c421bb18c87ac8731ab04e009ad0e6def07d72584a34172a2e5b035ee15c","observation_id":"59bd219b-acaf-4158-9483-a56f0ca825b3","resolution":{"observed_at":"2026-08-06T22:22:42.582486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 1 inbound Pith citation observation for arXiv:2506.21863."}