{"as_of":"2026-08-11T20:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:481d5d9a3ad60f0570593254189783dd631dcc2d92950d32a7896d2935348cc6","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:46:17.694478Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.07396/citation-record","integrity":"/paper/2501.07396/integrity","json":"/paper/2501.07396/citation-record.json","paper":"/paper/2501.07396"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.829348Z","title":"Automatic target recognition: State of the art survey,","venue":null,"work_id":"c52179c3-d42b-40e2-8110-c3568003be7f","year":1986},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.374768Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:dddd591b175270675b3031cb34248b9e20fc4b80cf20830f89233bea491633d9","observation_id":"dc4496b5-fd0c-46ab-91f9-26c200c68b4c","resolution":{"observed_at":"2026-08-10T20:46:18.834997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.813314Z","title":"The automatic target-recognition system in saip,","venue":null,"work_id":"f87b0cfc-f0c1-4cd6-b2fd-386e5d110bdf","year":1997},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.381241Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:03a2776c3e27e9a060b5c9075c0ce4bc156b48b8d06c8cbd29a6888d9991a68e","observation_id":"deb2b37f-8c78-4fad-99bb-31a88772cdd6","resolution":{"observed_at":"2026-08-10T20:46:18.818626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.796868Z","title":"Automatic target recognition based on simultaneous sparse representation,","venue":null,"work_id":"e93242aa-9f7a-4d07-a5a6-415029de7d0f","year":2010},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.387093Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:0f81bcf501097e5c4338461711d72266998479e2209cc1a3337ade51d0eb654e","observation_id":"628ebbc3-5f95-40f0-9ee2-26aa53bcd266","resolution":{"observed_at":"2026-08-10T20:46:18.802021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-10T20:46:17.392630Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.392630Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:560cb4cea7010c0972928e1e7714f7709eaaa7a7fc708b22366f546602204137","observation_id":"4e6c73a9-c868-4b61-b8ca-88bb210ff7cb","resolution":{"observed_at":"2026-08-10T20:46:17.392630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.779073Z","title":"Accelerating very deep convo- lutional networks for classification and detection,","venue":null,"work_id":"30fba736-2651-4a77-969c-7b4c7ab58036","year":1943},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.398774Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:eed14480d7179884f1e3253eab8d475a33b3f4a372517213459ced56a2f1fbc3","observation_id":"46d17d76-732e-4fda-8706-f359b60fa1d1","resolution":{"observed_at":"2026-08-10T20:46:18.785148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.761209Z","title":"Object recognition and detection with deep learning for autonomous driving applications,","venue":null,"work_id":"e068ea46-76bf-4cab-ba0d-90a795609f5d","year":2017},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.405012Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:805c8c7a09485c7e44bd64effa6602c4ce0ffeddf465886a754fb32be7aa3f57","observation_id":"2ac91e57-5e08-4285-abd8-0f06487b36e1","resolution":{"observed_at":"2026-08-10T20:46:18.767055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.744078Z","title":"Review of current aided/automatic target acquisition technology for military target acquisition tasks,","venue":null,"work_id":"cb41456f-c602-44ee-a7b0-76da5ad33584","year":2011},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.411534Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:3bff3e38051b2876e78a7f2b1fabaf1e1bc65e765535fb4b78f4b690211e476b","observation_id":"2ee9df0e-93e5-4706-a3d3-096251c60349","resolution":{"observed_at":"2026-08-10T20:46:18.749576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.724780Z","title":"Ar- tificial intelligence for national security: the predictability problem,","venue":null,"work_id":"aea0597d-8bb1-4ab5-8e04-c5c213eecf2a","year":2022},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.416710Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:dcc57c89a53997dd547de1d4daa3460835cea51c2ac219c5ccce69864d54046e","observation_id":"d55f1fb0-da79-459d-b3b2-b17762f17f2c","resolution":{"observed_at":"2026-08-10T20:46:18.730995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.705364Z","title":"Autonomous vehicles and intelligent automation: Applications, challenges, and opportuni- ties,","venue":null,"work_id":"ba27a6d6-2c23-4fd7-9005-9cce3866f1e6","year":2022},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.421818Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:9ddbad627dcb1fd944523a5c4118b077e007c64c6e69790b5fccf928524ffe65","observation_id":"fa2075fe-048a-4597-be49-ce93699e3c89","resolution":{"observed_at":"2026-08-10T20:46:18.711538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-10T20:46:17.427517Z","title":"Concrete problems in ai safety,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.427517Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:37ffd5e40462d1fa6aefa8dc28a85bd1f65db8917cd13e56c643bfcd8ef91aba","observation_id":"3b11ccae-5cf1-469f-a63c-e7a9d281d582","resolution":{"observed_at":"2026-08-10T20:46:17.427517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13916","last_updated":"2022-06-16T21:12:42Z","snapshot_observed_at":"2026-07-06T11:52:19.105210Z","submitted_at":"2021-09-28T17:59:36Z","title":"Unsolved Problems in ML Safety","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13916","snapshot_observed_at":"2026-08-10T20:46:17.433550Z","title":"Unsolved problems in ML safety,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.433550Z"},"links":{"cited_paper":"/paper/2109.13916","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:feafdec71b2d994c496e999bfa8e6e875df84949003438577bc67d1d55b2ef96","observation_id":"b605cf6d-5f96-4a3f-887d-4278d402d013","resolution":{"observed_at":"2026-08-10T20:46:17.433550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.687912Z","title":"Generalized out-of-distribution detection: A survey,","venue":null,"work_id":"42771fd0-eaf4-43d6-be89-11756ea5778e","year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.439485Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:105aad5c5b8c23885244b12d56c11b6f222657ae1da8969f0ea9b42f8f66a00a","observation_id":"7e493f4a-57f0-4958-b834-c7f3cf6430cd","resolution":{"observed_at":"2026-08-10T20:46:18.693809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21794","last_updated":"2025-06-18T17:03:35Z","snapshot_observed_at":"2026-08-10T08:43:59.815571Z","submitted_at":"2024-07-31T17:59:58Z","title":"Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21794","snapshot_observed_at":"2026-08-10T20:46:17.447333Z","title":"Generalized out-of-distribution detection and beyond in vision language model era: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.447333Z"},"links":{"cited_paper":"/paper/2407.21794","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:a1311e653fbffecaefd346024c79f146574dd8af6dbaef4dbe23002cfd5fc1ce","observation_id":"c93f806d-e52f-4c3d-9c85-3652a3a3388a","resolution":{"observed_at":"2026-08-10T20:46:17.447333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.668527Z","title":"Meta-uda: Unsupervised domain adaptive thermal object detection using meta- learning,","venue":null,"work_id":"65310d0f-caf0-43d1-ae87-6596b683a6e8","year":2022},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.456373Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:898c408b64a0ed0eb9666a1cd08dc5d574a8ad87af7f6bcf87d6ebc856e32b1f","observation_id":"61e44d9c-526c-44a1-980c-317f19e760b2","resolution":{"observed_at":"2026-08-10T20:46:18.674478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01530","last_updated":"2019-12-29T21:38:54Z","snapshot_observed_at":"2026-08-04T17:35:53.421663Z","submitted_at":"2019-12-03T17:18:08Z","title":"On the Validity of Bayesian Neural Networks for Uncertainty Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01530","snapshot_observed_at":"2026-08-10T20:46:17.463672Z","title":"On the validity of bayesian neural net- works for uncertainty estimation,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.463672Z"},"links":{"cited_paper":"/paper/1912.01530","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:e0be5aa45c6142c0e0816dd5acd35f327b6952ae5101f110b9c94bcda5ecfa22","observation_id":"887be8d0-66c2-46fd-b644-e42173d6e812","resolution":{"observed_at":"2026-08-10T20:46:17.463672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.645461Z","title":"Knowing the unknown: Open-world recognition for biodiversity datasets,","venue":null,"work_id":"0c16a490-a53d-4d2c-8d55-b90591da9fa2","year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.470110Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:01b425473578472e4bb12efab456c2dacebabbe4c64b9e74e2e2e003b0737ac0","observation_id":"956611e8-b9d7-424e-b118-db9623b8799b","resolution":{"observed_at":"2026-08-10T20:46:18.654570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.07228","last_updated":"2024-12-01T17:59:04Z","snapshot_observed_at":"2026-08-07T07:36:23.924329Z","submitted_at":"2018-02-20T18:07:50Z","title":"The Malicious Use of Artificial Intelligence: Forecasting, Prevention, and Mitigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.07228","snapshot_observed_at":"2026-08-10T20:46:17.476115Z","title":"The malicious use of artificial intelligence: Forecasting, prevention, and mitigation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.476115Z"},"links":{"cited_paper":"/paper/1802.07228","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:c7db0268c31a1d18b5c5e753c15409e97a12789356ba2998419062d679eb307d","observation_id":"afb4a997-c6af-4c7b-ab59-a2d84a370710","resolution":{"observed_at":"2026-08-10T20:46:17.476115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.626290Z","title":"The impact of cooperative perception on decision making and planning of autonomous vehicles,","venue":null,"work_id":"f28c3bc8-08c5-4ebc-9255-f62089aa624c","year":2015},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.482475Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:532f775920ef1e9badd9649f8348c779169381b6f2afdf50f1ea1722d5a74ea1","observation_id":"9f8c79a3-6e31-425a-a1cf-bcf827769365","resolution":{"observed_at":"2026-08-10T20:46:18.631899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.607221Z","title":"Towards open world object detection,","venue":null,"work_id":"627b39fc-0774-47da-a509-20de015537ad","year":2021},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.487875Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:a68d18295c23843c3d7f60a39e4a352b29d2fa50b845484147303035bf41fc3c","observation_id":"18650a64-b00d-4e38-9f95-5c14fa8f8f0d","resolution":{"observed_at":"2026-08-10T20:46:18.612993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.586646Z","title":"Unidentified video objects: A benchmark for dense, open-world segmentation,","venue":null,"work_id":"3c21a551-2aea-4a9f-a391-4fb03bd81647","year":2021},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.494173Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:f9e0141d39799650653451d566462c6a4cac2269e9ccd7a9a4c9f704f420ea73","observation_id":"3557120f-3e8a-499c-9c20-9c72cd041094","resolution":{"observed_at":"2026-08-10T20:46:18.593469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.564891Z","title":"Breaking the closed world assumption in text classification,","venue":null,"work_id":"968b0d3f-e7a0-44cb-bd50-d99f50b39c66","year":2016},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.500174Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:9399c5f47ee3599b00db4c67e616a16ff245148aa6d4ee959a4ac7572a1766c1","observation_id":"ce836303-24dc-43b6-a461-a341b50e7740","resolution":{"observed_at":"2026-08-10T20:46:18.571725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.542274Z","title":"Dynamic few-shot visual learning with- out forgetting,","venue":null,"work_id":"3ad5fb2b-cb65-4186-8ff1-bea52174aa11","year":2018},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.505787Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:dbc1e2d6a355e0272b740ba1fee847d07e2dfeb74435e32ea7a424d0abd1e9b3","observation_id":"ea92b599-17d7-46a9-a322-c5ba712bc5dc","resolution":{"observed_at":"2026-08-10T20:46:18.548146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.521018Z","title":"Online incremental learning algorithm for anomaly detection and prediction in health care,","venue":null,"work_id":"45e6a27c-333f-49f0-a972-4b5fe2d77f5e","year":2014},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.510843Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:bfd3f75baec856a15faa5b1b563efa71a12ac0f0485294e4d81011a563d93bff","observation_id":"8bcc5b1c-f476-4ad6-b3b0-f362cd51556f","resolution":{"observed_at":"2026-08-10T20:46:18.527791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.502839Z","title":"Detecting everything in the open world: Towards universal object detection,","venue":null,"work_id":"99039b90-9f23-416a-aa2c-ab984c3cb110","year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.516029Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:bdb524d873ab7c728eb90a7d0b173dd1a6952128b530a792a0c695c6227cd6b3","observation_id":"9cc440da-812c-4e8e-81a6-f3494dcd66f7","resolution":{"observed_at":"2026-08-10T20:46:18.508689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.484534Z","title":"Lifelong machine learning: a paradigm for continuous learn- ing,","venue":null,"work_id":"4e1e3654-8c45-4b33-a8ca-05cbd61fa0ac","year":2017},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.522741Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:88dff011e50eeecf6e2d8f4c4f0190d206816ee4a00002d707467155dd9b1a72","observation_id":"395b5ec9-e5df-4c32-8794-52872d63dba4","resolution":{"observed_at":"2026-08-10T20:46:18.490491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.460990Z","title":"Advancing autonomy through lifelong learning: a survey of autonomous intelligent systems,","venue":null,"work_id":"2b368eea-f0e1-43b9-8918-bb4fa54623b5","year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.528493Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:d5498f76e720b856ab890b65dd028eeaa9f353bab01f88ed96296d4414dfb00f","observation_id":"d5228723-27a2-4274-85bc-936f8796d8c8","resolution":{"observed_at":"2026-08-10T20:46:18.469681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:17.534017Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.534017Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:447b60f6ef4e068ed1d5d5555febb95a818bc860197bd522fe91af4ee1ed80f3","observation_id":"6e3661ee-815a-40ac-8a20-e8605608929b","resolution":{"observed_at":"2026-08-10T20:46:17.534017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10936","last_updated":"2022-07-16T01:27:59Z","snapshot_observed_at":"2026-07-06T12:40:27.042790Z","submitted_at":"2022-02-18T15:15:46Z","title":"A Survey of Vision-Language Pre-Trained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10936","snapshot_observed_at":"2026-08-10T20:46:17.539061Z","title":"A survey of vision-language pre-trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.539061Z"},"links":{"cited_paper":"/paper/2202.10936","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:2d2926adc5afa9709e16b2cee6e792f3630761bd45341cff49332bb9e4c2fa85","observation_id":"3028b6c9-a367-4e3b-8cfd-16f1f431f59b","resolution":{"observed_at":"2026-08-10T20:46:17.539061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:17.545977Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.545977Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:624933fb5c7818677c5a190613e02548a2f547bca0290335c02db843dc5f3f1f","observation_id":"b8fdba8b-e753-4669-865b-9acaaae85c12","resolution":{"observed_at":"2026-08-10T20:46:17.545977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.407790Z","title":"Clip and complementary meth- ods,","venue":null,"work_id":"ac67dbde-6adb-4f94-bb0d-f6babcfa7c68","year":2021},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.552208Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:a3f0174b41c4c891f141d10a6c9fe9948ccdf98eca332479d467313a95046fd3","observation_id":"7288af76-c6fe-4578-8b7d-3f916fb0e767","resolution":{"observed_at":"2026-08-10T20:46:18.415380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10340","last_updated":"2025-03-07T04:01:59Z","snapshot_observed_at":"2026-08-10T05:49:57.627213Z","submitted_at":"2024-02-15T22:01:45Z","title":"On the Vulnerability of LLM/VLM-Controlled Robotics","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10340","snapshot_observed_at":"2026-08-10T20:46:17.557968Z","title":"On the safety concerns of deploying llms/vlms in robotics: Highlighting the risks and vulnerabilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.557968Z"},"links":{"cited_paper":"/paper/2402.10340","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:9f1e0bd0048eee2f1fedec740a4e289621d9eed74a6586f0e54c8d6e29c03540","observation_id":"e7909ff5-7b6c-4221-ab62-1b96b31c740a","resolution":{"observed_at":"2026-08-10T20:46:17.557968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.379720Z","title":"Applications of large language models for robot navigation and scene understanding,","venue":null,"work_id":"6cb62cb7-3b24-4c58-8d2c-5ce3ed311e1e","year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.563485Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:e5cb2ef934b4f2dcf52a1be6430fd151a619f70947943451d41bd51a921c83ae","observation_id":"453d7c37-b7d8-4046-85dd-a25282ffcad3","resolution":{"observed_at":"2026-08-10T20:46:18.387080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07872","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-02T06:03:03.152035Z","submitted_at":"2024-02-12T18:33:47Z","title":"PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07872","snapshot_observed_at":"2026-08-10T20:46:17.569537Z","title":"Pivot: Iterative visual prompting elicits actionable knowledge for vlms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.569537Z"},"links":{"cited_paper":"/paper/2402.07872","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:0065516f1ec49b314cd39682779d5723fa5158ba3a7d3d7b5bf0330f970ab1a8","observation_id":"a2476a74-ef01-4a2f-9994-a2999e1149e1","resolution":{"observed_at":"2026-08-10T20:46:17.569537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.353921Z","title":"Yolo-world: Real-time open-vocabulary object detection,","venue":null,"work_id":"624dab83-87bf-4e5d-9f04-5baafe6f96db","year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.574846Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:3c0b1b5c23c699b4102a32b2ece33460297185b40cbb397812b29242de546816","observation_id":"d96ccc21-8e9b-461b-94f0-36234a8aeebb","resolution":{"observed_at":"2026-08-10T20:46:18.361176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.333473Z","title":"Towards open world recognition,","venue":null,"work_id":"dddbf669-43c4-4c98-af56-6e3ba4cbf707","year":2015},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.579856Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:8740b5d6b6a644599866c3c73703b445481fae826ac098276caa2bf48c098d7b","observation_id":"d7c1a4f4-a43d-42f7-9a0e-0e1039cb037c","resolution":{"observed_at":"2026-08-10T20:46:18.340303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.312621Z","title":"Ow-detr: Open-world detection transformer,","venue":null,"work_id":"792bcd71-0ced-4ee2-b586-798b55bba65d","year":2022},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.585082Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:2bd567dee050fc227d9392b29f853abb3c6222939f8ad4541451a017a5d217e7","observation_id":"b9d88c8b-1109-4117-bf61-8bdc8c25937b","resolution":{"observed_at":"2026-08-10T20:46:18.319089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.292504Z","title":"Exploring vision-language foundation model for novel object captioning,","venue":null,"work_id":"6252c5d0-59f7-4d9e-93c2-ee7d1c203ff6","year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.590635Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:35c2b97be52c258f74497568101b640973cdfe93b7bf6bf10edf3e7cb367720a","observation_id":"0b954148-e704-47c9-ad46-6d563de1407c","resolution":{"observed_at":"2026-08-10T20:46:18.298902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.271740Z","title":"Improved open world object detection using class-wise feature space learning,","venue":null,"work_id":"d20bfad8-56eb-4252-97dd-366cbff51dbf","year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.595627Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:dc70481917ea1e7d77912d4adff9c3bff61e398d1f240340f1aff34434c04422","observation_id":"76597959-bab1-413f-94ff-ce60661f6881","resolution":{"observed_at":"2026-08-10T20:46:18.278186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.07848","last_updated":"2021-04-29T15:28:55Z","snapshot_observed_at":"2026-07-06T10:41:37.896766Z","submitted_at":"2021-02-15T21:03:05Z","title":"Self-Supervised Features Improve Open-World Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.07848","snapshot_observed_at":"2026-08-10T20:46:17.601016Z","title":"Self-supervised features improve open-world learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.601016Z"},"links":{"cited_paper":"/paper/2102.07848","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:32de34846739aa03f9f1fc63ec6c5444c3f193fc9c5ec8894d6ad7e0bd4047e8","observation_id":"efbc1feb-d4b8-474f-ad30-a67c0c1e6cfb","resolution":{"observed_at":"2026-08-10T20:46:17.601016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09911","last_updated":"2022-12-24T10:12:53Z","snapshot_observed_at":"2026-08-10T20:46:48.127668Z","submitted_at":"2022-05-20T00:53:43Z","title":"Can Foundation Models Wrangle Your Data?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09911","snapshot_observed_at":"2026-08-10T20:46:17.606731Z","title":"Can foundation models wrangle your data?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.606731Z"},"links":{"cited_paper":"/paper/2205.09911","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:2e8d8480d62b773f80734bb799905310d9300b726e2d39f8768c4200932130b6","observation_id":"b127b10a-ac6d-4846-8f55-25336d39a4df","resolution":{"observed_at":"2026-08-10T20:46:17.606731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:17.612848Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.612848Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:05b0e2c0ff22d8f05931591f3513b02759917249bb009d1396988c729b774415","observation_id":"a2a538d1-006f-4a65-baea-4ef941aa657d","resolution":{"observed_at":"2026-08-10T20:46:17.612848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.234845Z","title":"Dremel: interactive analysis of web- scale datasets,","venue":null,"work_id":"0ba179f2-9e0c-4bcf-b7e9-37098aa4e433","year":2010},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.618638Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:dbe46d90ac6349f09b2e19a6c47aec5945a25b788bb6356d8211b4e5fa1d43b3","observation_id":"8100238f-25b0-4abc-8038-659a9b11933e","resolution":{"observed_at":"2026-08-10T20:46:18.242910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.215399Z","title":"Open-set automatic target recognition,","venue":null,"work_id":"3531742c-d51e-4e04-a3a6-02ca7c5f1c23","year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.623741Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:279a9d18946ff17e0e9ea6337c4b4593548e8e63ddbe94996953abd48a3011a3","observation_id":"2dd39ac8-f27e-41f9-a95c-b3e7ec337969","resolution":{"observed_at":"2026-08-10T20:46:18.222306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.195132Z","title":"Hello gpt-4o,","venue":null,"work_id":"371fa1fc-566a-46e7-9da5-015d9c47a599","year":null},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.628432Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:8c423c9afcf1dd9c3125302280bb8165144964c8a029c1d21fa080997982d171","observation_id":"c1b8d13e-7ca8-4b87-bd24-f931dd2c8f65","resolution":{"observed_at":"2026-08-10T20:46:18.201005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.174289Z","title":"Introducing the next generation of Claude,","venue":null,"work_id":"c8006c05-eb3d-40ce-933b-ea7711a8e5e4","year":null},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.633888Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:17d9c977a7ef4a10d67c8e6e18fe4b44efa39ac44eaba101f841806658449b05","observation_id":"842953ae-91a4-4f14-891e-1db88ca75f28","resolution":{"observed_at":"2026-08-10T20:46:18.179771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T20:46:17.639653Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.639653Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:f7b0c80b2ff48d391dadd3555787cf6fbea6c0c769a7ba2a98771aa0678043aa","observation_id":"b27e26fb-fcc0-49a8-90ed-e73ab01a0593","resolution":{"observed_at":"2026-08-10T20:46:17.639653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:17.645260Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.645260Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:b3779b9f8198de00fb08b81262e1a463b813c80e33ba54518b73703b94d71824","observation_id":"850b3a59-bbfa-40ef-8874-53338b3d1d51","resolution":{"observed_at":"2026-08-10T20:46:17.645260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T20:46:17.650325Z","title":"Phi- 3 technical report: A highly capable language model locally on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.650325Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:cd699382f20e0534c6d7d6c8219c9507cc3eee0333d2471ef54abb55cff2b65f","observation_id":"0f460483-556d-4f6f-9e4a-7d8a4a66c3c7","resolution":{"observed_at":"2026-08-10T20:46:17.650325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T20:46:17.656050Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.656050Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:d4911bb1cd9c9c63fdf8d82ffd8ac57d16273bb9704d480434b514fb555a9b71","observation_id":"abdd08d9-1c36-4410-8b3f-a3c06f7b886e","resolution":{"observed_at":"2026-08-10T20:46:17.656050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-10T20:46:17.661661Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.661661Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:343bb2cd2af0f80a818886b2029ebab4648d8fe785a32a31a3dc7b761f4ce5a0","observation_id":"baf40376-7db4-4934-b7f0-31b2c146b65d","resolution":{"observed_at":"2026-08-10T20:46:17.661661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:17.667544Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.667544Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:0ac87b46a14cbedab6f468dc5947e1f752b9d9e73630e9fc016ece4333e3569b","observation_id":"e70e6963-3c31-4288-8316-446f2b95e8ce","resolution":{"observed_at":"2026-08-10T20:46:17.667544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-10T20:46:17.674626Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.674626Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:e34b3cea8bd45f7a654c325b1b69543391efdcc88ed9ec180c2dbf90135896a7","observation_id":"0c7a0eb7-ceb2-47c2-a88a-fabe790fdcc5","resolution":{"observed_at":"2026-08-10T20:46:17.674626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-10T20:46:17.682505Z","title":"Openflamingo: An open-source framework for training large autoregressive vision- language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.682505Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:fecbe1ba2022d3ec92cf4b3ac1d292a3297564688b47d3b2de2919ac6c25a41d","observation_id":"db8982d9-9f25-44eb-853e-c358b5033992","resolution":{"observed_at":"2026-08-10T20:46:17.682505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:17.688475Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.688475Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:359e12612fafb2ba0c649e98b08b2d5ece6f0e78cd31480c91dd7b4f7c37e17d","observation_id":"e7b3e0cf-a358-4251-af24-08db5e931210","resolution":{"observed_at":"2026-08-10T20:46:17.688475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:46:18.114815Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"d12f8837-cb95-4abc-b865-52cdacbcdca5","year":2023},"citing_paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:46:17.694478Z"},"links":{"citing_paper":"/paper/2501.07396"},"observation_digest":"sha256:02cef6ffb5169693e832d5f2b9b19e59a3dd58b10666ca46da7735715a5aff62","observation_id":"b119770c-7a56-4c32-8844-bbd146a65641","resolution":{"observed_at":"2026-08-10T20:46:18.123979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.07396","last_updated":"2025-01-13T15:11:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T20:40:09.124138Z","submitted_at":"2025-01-13T15:11:27Z","title":"Zero-Shot Scene Understanding for Automatic Target Recognition Using Large Vision-Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2501.07396."}