{"as_of":"2026-08-09T04:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc563318b0c4d483eb12b57d0026ef662573bfaae7fdcae6a496e5fb77bd4db4","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:12:59.323308Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:19:24.701282Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19288","snapshot_observed_at":"2026-08-04T19:19:24.701282Z","title":"Da yu: Towards usv-based image captioning for waterway surveillance and scene understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10570","last_updated":"2025-09-11T10:30:06Z","snapshot_observed_at":"2026-08-07T17:01:22.354040Z","submitted_at":"2025-09-11T10:30:06Z","title":"Large Foundation Models for Trajectory Prediction in Autonomous Driving: A Comprehensive Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T19:19:24.701282Z"},"links":{"cited_paper":"/paper/2506.19288","citing_paper":"/paper/2509.10570"},"observation_digest":"sha256:315bdcf2152a048ecad68c9cf57c927f096d93a47fdd764ffa9f0229c9b42ca1","observation_id":"9fdddfd6-4ace-4f4d-9d43-1eb7af353c64","resolution":{"observed_at":"2026-08-04T19:19:24.701282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19288/citation-record","integrity":"/paper/2506.19288/integrity","json":"/paper/2506.19288/citation-record.json","paper":"/paper/2506.19288"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:06.827323Z","title":"A data set for airborne maritime surveillance environments,","venue":null,"work_id":"e2b9307d-9cce-4c42-977b-cbfea1e9eaf3","year":2017},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:54.380544Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:1cd7f37ea2ed18d601e55e3f9cb0bac7dbbdd3aabb123099db09ed54bf3b9338","observation_id":"d3528a83-a7ee-40c9-8223-310854cfe123","resolution":{"observed_at":"2026-08-06T23:13:06.929626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:06.518205Z","title":"Asy-vrnet: Waterway panoptic driving perception model based on asymmetric fair fusion of vision and 4d mmwave radar,","venue":null,"work_id":"ef655924-f808-489f-baaa-bb014cbeca4c","year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:54.500267Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:f49aa33d6f91e05ace1fed5194b9f37a3a7d921df98711a41f015303431e6c35","observation_id":"27844cef-f1f5-49bf-89ae-bd96dc7abad6","resolution":{"observed_at":"2026-08-06T23:13:06.623178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:06.327062Z","title":"Usvtrack: Usv-based 4d radar-camera tracking dataset for autonomous driving in inland waterways,","venue":null,"work_id":"b66c464b-d61e-4f76-8bc3-065571294569","year":2025},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:54.565772Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:7922f1639748710bf13ddfc43791fad6883158632f1090ff266546e4d8e9c74b","observation_id":"d187f314-9867-4cd8-92e4-20129d9884a0","resolution":{"observed_at":"2026-08-06T23:13:06.412323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:06.106157Z","title":"Are we ready for unmanned surface vehicles in inland waterways? the usvinland multisensor dataset and benchmark,","venue":null,"work_id":"80c800c8-6457-4bd9-9d33-982d09125f5d","year":2021},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:54.693238Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:b3923047de412b9596e0ff4693669f04b1c26a5b5eb483d98fb73d8af79869d2","observation_id":"58f25f48-1449-4749-baeb-add1f0d6227c","resolution":{"observed_at":"2026-08-06T23:13:06.214649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:05.962232Z","title":"Achelous: A fast unified water-surface panoptic perception framework based on fusion of monocular camera and 4d mmwave radar,","venue":null,"work_id":"a9f63f44-7d8b-44ce-a74c-e74e3f6820e7","year":2023},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:54.824633Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:36b7cd8c8f0068b8c780c95acac682e24c2d468bd93ca6fc4b25d79d3ae6ae0f","observation_id":"2c3b71b9-e01b-4816-bcc3-40a397e49e88","resolution":{"observed_at":"2026-08-06T23:13:06.026304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08851","last_updated":"2023-12-14T12:10:12Z","snapshot_observed_at":"2026-07-06T17:01:35.415575Z","submitted_at":"2023-12-14T12:10:12Z","title":"Achelous++: Power-Oriented Water-Surface Panoptic Perception Framework on Edge Devices based on Vision-Radar Fusion and Pruning of Heterogeneous Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08851","snapshot_observed_at":"2026-08-06T23:12:54.910034Z","title":"Achelous++: Power-oriented water- surface panoptic perception framework on edge devices based on vision- radar fusion and pruning of heterogeneous modalities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:54.910034Z"},"links":{"cited_paper":"/paper/2312.08851","citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:51050bd2ea6dd79f9c6e5b8de2043d341bc83612ffb80011c19085bc7620b7a2","observation_id":"79cf704c-20eb-4558-a91b-4e448572d1cc","resolution":{"observed_at":"2026-08-06T23:12:54.910034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:05.784978Z","title":"Watervg: Waterway visual grounding based on text-guided vision and mmwave radar,","venue":null,"work_id":"ce698b85-3fa8-4ebf-a99c-797de04661b8","year":2025},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.019750Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:9831009918e9fff6a5c62cad9bf409b595a10232e00718e0a1b193131a01c45c","observation_id":"0576f8b1-8e07-4bea-8e14-96544a8f7a1f","resolution":{"observed_at":"2026-08-06T23:13:05.860607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T23:12:55.097495Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.097495Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:0a3519c993acaf47561f4c0958db6159d5aa6aec8ae38a03244026a49cddead8","observation_id":"7f149857-30d3-4942-a92c-43a369d6c990","resolution":{"observed_at":"2026-08-06T23:12:55.097495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:05.631147Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models,","venue":null,"work_id":"f394fa88-e4b2-48dc-8b86-5105f70884a3","year":2015},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.164644Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:f3c477e061acf94c086ed4d62abcf476ee9533db71945fe616b502039122b198","observation_id":"431507a3-2ede-4617-b2b5-ea98e04d71f4","resolution":{"observed_at":"2026-08-06T23:13:05.709641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:05.466425Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts,","venue":null,"work_id":"905fb304-ffa6-4180-9138-4719e5f26049","year":2021},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.220892Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:ca2edf7f1f3337761c40792269cfbcd6cdd2dee5de43f585dab31f7d5e1d915e","observation_id":"7334db13-52ec-418f-87ab-77411f5f0147","resolution":{"observed_at":"2026-08-06T23:13:05.546474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:05.300174Z","title":"Im2text: Describing images using 1 million captioned photographs,","venue":null,"work_id":"5c47d269-cc35-4453-84cf-fcb23121a0ad","year":2011},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.270503Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:029b53801e685f303ad34d2dbe97cff8003da1ffa8d22f0e66c7431c52699c5d","observation_id":"601eddcf-5424-4c4d-a648-0289034f962a","resolution":{"observed_at":"2026-08-06T23:13:05.365422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:05.095589Z","title":"Vizwiz grand challenge: Answering visual questions from blind people,","venue":null,"work_id":"f159a54a-c623-4c2c-92b8-381fe1eb2ed7","year":2018},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.337293Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:b38514f445aeeaee6772303c73b893b9e8ba6de57e53dfef93aaf899765de840","observation_id":"da03011a-f677-40e5-b2df-e04dad77a848","resolution":{"observed_at":"2026-08-06T23:13:05.181603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:04.875276Z","title":"Learning deep represen- tations of fine-grained visual descriptions,","venue":null,"work_id":"9a7b24ab-3739-406a-bda7-68fee865597f","year":2016},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.390881Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:48adc279720262ebd4649bde93a35238330de68a98e4f832972c7c94cd12b7d7","observation_id":"e1d16594-950c-45b2-9659-bccd1f4ee483","resolution":{"observed_at":"2026-08-06T23:13:04.957616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:04.645062Z","title":"Fashion captioning: Towards generating accurate descrip- tions with semantic rewards,","venue":null,"work_id":"a929b5d7-85c7-4911-a645-04cc567929bd","year":2020},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.446462Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:faf8d7859586968b17d82c955c126533fab64accf1f24dfa568a5e31a7c5796a","observation_id":"2cb29d9f-7359-49d0-8fde-146b32fce0fe","resolution":{"observed_at":"2026-08-06T23:13:04.757576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:04.374573Z","title":"Break- ingnews: Article annotation by image and text processing,","venue":null,"work_id":"04d748bf-45d9-490a-a303-3663cb1d8503","year":2017},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.500107Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:ac4f9601de5919923782370b632be1ad706603dfcacb9b25f25754a14d720ce2","observation_id":"4022af13-e19d-43dc-918c-2f1726fbd04d","resolution":{"observed_at":"2026-08-06T23:13:04.514738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:04.150506Z","title":"Textcaps: a dataset for image captioning with reading comprehension,","venue":null,"work_id":"8e6685a5-dd41-4845-a01a-22505436dbc3","year":2020},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.578720Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:ae08b9a032f342da3dfb8fec2a125893aeafda6392b98631b527f2ac0c2d9d36","observation_id":"75037dd3-a52a-4951-b344-c6a3f57d8f03","resolution":{"observed_at":"2026-08-06T23:13:04.264772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:03.925725Z","title":"Deep learning approaches on image captioning: A review,","venue":null,"work_id":"5731d812-1464-4ae8-8fc2-1a637083695c","year":2023},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.637589Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:362982668781150497dc6ce0755de945f752408f5c941ae68911a55d4e18816a","observation_id":"329a93c2-2979-4e66-b914-a3310f0f000e","resolution":{"observed_at":"2026-08-06T23:13:04.048418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:03.747229Z","title":"Waterscenes: A multi-task 4d radar-camera fusion dataset and benchmarks for autonomous driving on water surfaces,","venue":null,"work_id":"860d01e4-3fc8-43ff-ad97-aa990115f586","year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.692726Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:e52a88d700c29335c8696e757b4aea9550ac021a8b9fb32db0d1776a80ad8a54","observation_id":"5ebd6dec-ff85-48d5-ba1d-f98c01e19e20","resolution":{"observed_at":"2026-08-06T23:13:03.821704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:03.561518Z","title":null,"venue":null,"work_id":"9bf47e2f-abe1-43bd-a62d-b755ca8ef9c3","year":2018},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.735704Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:e727727938be27cf45b533dd067b37e4a0c73151f745688ec4e737bcb7791793","observation_id":"8a1acd54-b7bc-4ea2-8881-6048d843805c","resolution":{"observed_at":"2026-08-06T23:13:03.672962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-07-06T17:26:02.434883Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-06T23:12:55.793428Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.793428Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:2d971454ea947d19c58ee43817acbc555b58e97baf0087e8e2590f4ddbc61a8d","observation_id":"c198008a-e337-447b-8511-0a07ceeeca1c","resolution":{"observed_at":"2026-08-06T23:12:55.793428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:55.845170Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.845170Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:31c7adfd928f6b3affde6fd6b2c7d6bfc938a2e78323d063a71187d30f524675","observation_id":"dfaff453-8f72-497a-862d-28849e747998","resolution":{"observed_at":"2026-08-06T23:12:55.845170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:55.902203Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.902203Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:5a9f24764a15755e07e7fd6f453584ce8f74576a51199ec1558feb8203646835","observation_id":"a0c4bf0c-1a5d-4af1-aaf4-e86de4796e50","resolution":{"observed_at":"2026-08-06T23:12:55.902203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:55.972188Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:55.972188Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:dd2a3b055783f7c2ad60a10325f06aade5b4ad9574d0f57e1f07b5adc016ce83","observation_id":"615558af-e3db-48dd-94ec-a9b5986425d3","resolution":{"observed_at":"2026-08-06T23:12:55.972188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:56.022808Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:56.022808Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:880b2259bc934ee9b6ef6efcb48f2d7d6d8754717e868180854d96fbe3ce34da","observation_id":"8d91ef8b-87e7-4f03-b628-b2e580385b65","resolution":{"observed_at":"2026-08-06T23:12:56.022808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:56.086648Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:56.086648Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:84c9baa56cd43886d55074eb20bb907099f0cfbae5e8dbb07d734e5d49b9fcae","observation_id":"811bea4f-c2ec-423b-9955-40aacfb6ac4f","resolution":{"observed_at":"2026-08-06T23:12:56.086648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:03.341850Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":"7147cb23-c6f3-408a-b1bd-d5d9795b176c","year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:56.155414Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:89c4d0e7615c0835bf3b78a8fc2c61f22d2c3beed00e0627b6871a44bd613155","observation_id":"7e759b75-38a1-4828-a366-2cae7131c08d","resolution":{"observed_at":"2026-08-06T23:13:03.389808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:56.258705Z","title":"Task-adaptive attention for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:56.258705Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:70bf9aa75f946e6542240158e192bf194dc29c554bd24b9cda496dedb141a13c","observation_id":"3174bdf5-d3e6-42cf-a494-b862fee32ba3","resolution":{"observed_at":"2026-08-06T23:12:56.258705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:03.053384Z","title":"Vision-enhanced and consensus- aware transformer for image captioning,","venue":null,"work_id":"f4f20679-ac75-40c8-b9c6-456969fc1e0a","year":2022},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:56.355939Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:708e26e0156dd172dc376f850a10b4ef118c8aee6881f7f6f5d107894f19d110","observation_id":"f5901940-4ad3-43da-97f9-3d76d4d4e981","resolution":{"observed_at":"2026-08-06T23:13:03.193848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:02.874699Z","title":"Adaptive path selection for dynamic image captioning,","venue":null,"work_id":"7fabc871-a733-4b74-bf42-8f01441aa36e","year":2022},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:56.434598Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:dbd3cab3395cdb71a01344957317c0681f23f1e7e5883e4c244890cf9ec67222","observation_id":"b1cb9332-8d86-436e-8410-4221571f69a7","resolution":{"observed_at":"2026-08-06T23:13:02.958702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:02.646163Z","title":"Double-stream position learning trans- JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, AUGUST 2015 14 former network for image captioning,","venue":null,"work_id":"329a7a69-e0da-4b77-b195-68f30acbf85a","year":2015},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:56.534168Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:5b67e6babd2ebd69fa064941fa0f2109fd7b05e78293202b65eb329915c622f2","observation_id":"c81c2a21-60cd-4941-b0fa-f8d52be3c83e","resolution":{"observed_at":"2026-08-06T23:13:02.744958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:02.487060Z","title":"A comprehen- sive survey of 3d dense captioning: Localizing and describing objects in 3d scenes,","venue":null,"work_id":"fdf3eb12-a23d-45de-887a-0eb243a214c0","year":2023},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:56.603663Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:8e20e37b77537d7db85bb414999647a12567daa56b6d704313b826ef7c9d0fdf","observation_id":"4ebe8d1e-bf2b-449c-8e2e-150ce11c4437","resolution":{"observed_at":"2026-08-06T23:13:02.556920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:02.310874Z","title":"Spt: Spatial pyramid transformer for image captioning,","venue":null,"work_id":"6acaec75-777b-4de5-946c-18c96baa11c8","year":2023},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:56.743713Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:7e6670aa2571f9c82b5bac4bb3f49d8e5020bf6f9be532a8df5829f99dff9735","observation_id":"31978f6c-b1d4-4a7c-a8c2-79ae2febe81b","resolution":{"observed_at":"2026-08-06T23:13:02.375032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:56.928074Z","title":"Multimodal transformer with multi- view visual representation for image captioning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:56.928074Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:81e9a6fa40d8d1ac051004187a1ae0a945ffecf03695bff0deb8a8e2afac928c","observation_id":"c05fa789-e8b7-46ba-b3e6-d75d53bcf8d7","resolution":{"observed_at":"2026-08-06T23:12:56.928074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14818","last_updated":"2024-10-03T05:23:22Z","snapshot_observed_at":"2026-08-02T03:11:34.806235Z","submitted_at":"2024-09-23T08:47:54Z","title":"MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14818","snapshot_observed_at":"2026-08-06T23:12:56.998779Z","title":"Mobilevlm: A vision-language model for better intra-and inter-ui understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:56.998779Z"},"links":{"cited_paper":"/paper/2409.14818","citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:77df7c9870245317208b614a554dc5e414081848eb643eb3c29863a5f8db7b35","observation_id":"ccabe1f6-81d6-4c7e-9296-bd3d434b7c5b","resolution":{"observed_at":"2026-08-06T23:12:56.998779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:02.101654Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":"91eb845a-6054-4b76-9ab2-2f9f39813d52","year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:57.061781Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:8e8c822ca665054a37244d30e0bd06d95083d72be8ce3c0a5a87f604b8d3ad33","observation_id":"c5e489b2-72b8-42ec-b315-0eda9e0dcf3a","resolution":{"observed_at":"2026-08-06T23:13:02.224750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T23:12:57.142952Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:57.142952Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:647dd153bab8a8065006ff47650c01ab900ad836a35340729f64c6c781ed1c7a","observation_id":"500fdbab-b469-46d2-af42-cf3f814ed487","resolution":{"observed_at":"2026-08-06T23:12:57.142952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-03T05:27:32.394774Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-06T23:12:57.273153Z","title":"Tinyllava: A framework of small-scale large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:57.273153Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:d941b4ca67b8a1f4d7c6f5f8afccb44265488645f5edbff7eb9006da80cd364c","observation_id":"edbf4cf7-badf-40a5-b9ba-4172a7c575d7","resolution":{"observed_at":"2026-08-06T23:12:57.273153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:01.936433Z","title":"Mask-vrdet: A robust riverway panoptic perception model based on dual graph fusion of vision and 4d mmwave radar,","venue":null,"work_id":"c176c8bc-ae5d-4cba-b993-81e0b85c21a4","year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:57.364159Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:683d0565d76723f3d245ccfc389bbbe0ca21f856277d7e4bb8e1c8e1d422098a","observation_id":"aa0ae569-7531-44af-8e29-9d3b379ef496","resolution":{"observed_at":"2026-08-06T23:13:01.997200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17207","last_updated":"2025-02-12T03:15:52Z","snapshot_observed_at":"2026-07-06T19:08:09.037019Z","submitted_at":"2024-08-30T11:22:09Z","title":"NanoMVG: USV-Centric Low-Power Multi-Task Visual Grounding based on Prompt-Guided Camera and 4D mmWave Radar","version":2},"cited_work":{"arxiv_id":"2408.17207","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.17207","snapshot_observed_at":"2026-08-06T23:12:59.846778Z","title":"NanoMVG: USV-Centric Low-Power Multi-Task Visual Grounding based on Prompt-Guided Camera and 4D mmWave Radar","venue":"cs.CV","work_id":"4d11290d-f1c9-471e-8905-d9d4a8d22dff","year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:57.454821Z"},"links":{"cited_paper":"/paper/2408.17207","citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:07c2a729ac90eda72bb15adaedc7d00a16156cfdb2d11c2119fb84f4f2209c2a","observation_id":"af2b816b-3b25-4b3c-b476-0dcaae6dfda0","resolution":{"observed_at":"2026-08-06T23:12:59.949657Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:12:57.527835Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:57.527835Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:5732923ff96ed6efb36c842eed6b04e1654d46cc700cd825f87bbaa31080d6c4","observation_id":"6cab96c3-08cf-4e27-9026-62cc3e78ca61","resolution":{"observed_at":"2026-08-06T23:12:57.527835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T23:12:57.627616Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:57.627616Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:258b03ed13d3b467c93faf38d87b21c6ebc494a39a65186906f4b50ae52a8083","observation_id":"081bb90d-1ec1-4d9d-bdec-b68e315506ea","resolution":{"observed_at":"2026-08-06T23:12:57.627616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:01.759837Z","title":"Mobileclip: Fast image-text models through multi-modal reinforced training,","venue":null,"work_id":"8b2b6852-1f8e-4305-adcc-c7e82678dfde","year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:57.757659Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:169f02cc07308e51171ea9340eded4c658b7e76d45a5e299231a3e826660b83c","observation_id":"2111c1d1-a8db-441d-b219-6cc38c9c150c","resolution":{"observed_at":"2026-08-06T23:13:01.851137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:57.830163Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:57.830163Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:5bf2900dd0cbecb8a4a0bec4846374f37c117f299d82171de8969a3755a34be0","observation_id":"0c5fce76-134f-4e97-a4e0-9e70b75f8a98","resolution":{"observed_at":"2026-08-06T23:12:57.830163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:57.922031Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:57.922031Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:5afa47a0fa24986cc218eee2850a3594a9b2a0308f10212b98fc6c9fcc368de8","observation_id":"d61b9442-439c-4671-96b3-98a58e1265df","resolution":{"observed_at":"2026-08-06T23:12:57.922031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:01.559082Z","title":"Agent attention: On the integration of softmax and linear attention,","venue":null,"work_id":"25b7b307-b25c-406c-bf88-2c98cfe92312","year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:58.027415Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:0239b46b73c71c902c230960035c5a714ef7fdd6ca872377f2c102e530719a47","observation_id":"7bd0ff1f-2783-425c-8f03-d20c7b35d236","resolution":{"observed_at":"2026-08-06T23:13:01.649115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:01.234819Z","title":"Dual-level collaborative transformer for image captioning,","venue":null,"work_id":"713505a8-9273-41f9-961b-4bb805d757b2","year":2021},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:58.117598Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:49a59b3e3e18a03a13f095ad413cc8b11175af9d7033c8e60a5c5a85fbf17691","observation_id":"abb2ff5e-e04c-496d-9c7a-99f5e45d3fe4","resolution":{"observed_at":"2026-08-06T23:13:01.360157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:01.065833Z","title":"Comprehending and ordering seman- tics for image captioning,","venue":null,"work_id":"0fff95f2-2f41-4f8c-af70-b488621ab1c0","year":2022},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:58.239788Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:b6c23be52ebad7a0bcd295d33530043e2b7926c48b688bd97fa0d62dc4b58230","observation_id":"810a7100-652f-4612-bdfb-ef681593103d","resolution":{"observed_at":"2026-08-06T23:13:01.148678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:58.335734Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:58.335734Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:c4e666c7c59e01d5c2fa022e516c96bd0aa71d4ad16398f584d2a5850d3fad4b","observation_id":"c1a5c21e-a9df-45cd-b725-08b75466a7fa","resolution":{"observed_at":"2026-08-06T23:12:58.335734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:58.477687Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:58.477687Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:5dc1128b637ca2b8350ead670ec7975839bc3cd11acae7ed9f58f0c52dcfd73a","observation_id":"145b0466-f1ea-4ed3-9f35-537488884268","resolution":{"observed_at":"2026-08-06T23:12:58.477687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T23:12:58.578001Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:58.578001Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:09870c182c6835a5e8ee0b2ac097673961f73fad3316f04b6ff065d59298f599","observation_id":"666e3eec-e2e9-46bd-8dd8-258b15ae58fe","resolution":{"observed_at":"2026-08-06T23:12:58.578001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01516","last_updated":"2024-02-05T22:43:45Z","snapshot_observed_at":"2026-07-06T16:14:01.852423Z","submitted_at":"2023-09-04T10:48:29Z","title":"MultiWay-Adapater: Adapting large-scale multi-modal models for scalable image-text retrieval","version":3},"cited_work":{"arxiv_id":"2309.01516","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.01516","snapshot_observed_at":"2026-08-06T23:12:59.513938Z","title":"MultiWay-Adapater: Adapting large-scale multi-modal models for scalable image-text retrieval","venue":"cs.CV","work_id":"6e138c70-b4de-4c42-a759-c5eefa6dd3ff","year":2023},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:58.675967Z"},"links":{"cited_paper":"/paper/2309.01516","citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:33259cb587f9658cdffc5903a39fdd4b39d74e820feb13f1b4152b1270415886","observation_id":"427794b7-6134-4495-99f0-437837990883","resolution":{"observed_at":"2026-08-06T23:12:59.596017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:58.785881Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:58.785881Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:df3adb9b5f639fb0639f944c114f0180c3536269c2ca145890b104dfd5c1ba5c","observation_id":"44a722cf-0c9f-4a35-94af-64a5b07bfb53","resolution":{"observed_at":"2026-08-06T23:12:58.785881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:58.879043Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:58.879043Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:e8a6baf72acf0e634e17130208e27bb50673fd4c4498cbb774584f99f4d17fa3","observation_id":"976e26ed-e61f-4926-a8a6-318f66543f8d","resolution":{"observed_at":"2026-08-06T23:12:58.879043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:00.735102Z","title":"Lavie and A","venue":null,"work_id":"54a979e8-6b87-4325-b816-a56d13845079","year":2007},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:59.001834Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:eb4f5dc78424206d2520e4a5b1639f32c85ec9735e151ef9da439407eb24ef2d","observation_id":"410c64ab-1944-44a5-91c3-6d9a08ea2364","resolution":{"observed_at":"2026-08-06T23:13:00.851698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:59.106904Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:59.106904Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:c8551f31c43e53d6fd40e4171e43c5c99097297b31ce7e1eed2c8afad4b82347","observation_id":"7157aa19-ca8c-463a-8a93-0f58f8e2020a","resolution":{"observed_at":"2026-08-06T23:12:59.106904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:00.465499Z","title":"Drivelm: Driving with graph visual question answering,","venue":null,"work_id":"b9479d33-e971-4f26-a476-9b28c094fbd1","year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:59.233791Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:1c8ed250bcaaa31ffd7ec42679e4a3102901db6000bb20334e639535ac2a034d","observation_id":"1f34d844-ea05-4991-95c6-f0c3e2dfafa7","resolution":{"observed_at":"2026-08-06T23:13:00.559148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:13:00.218909Z","title":null,"venue":null,"work_id":"bb2e07f5-8252-4a32-857e-dfa3600b6330","year":2011},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:59.323308Z"},"links":{"citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:93cb26890b90037484d63550ffcddd29853db982575059593190999e6306793a","observation_id":"53883036-0972-4f8f-85de-8dcd25d81229","resolution":{"observed_at":"2026-08-06T23:13:00.327800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:04:52.143303Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":30},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2506.19288."}