Pith. sign in

Paper Citation Record · LEDGER

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis

As of 23 August 2026, this Paper Citation Record lists 100 of 146 outbound references and 3 inbound Pith citation observations for arXiv:2502.01785.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.01785 v1

Coverage vector

measured 100 of 146 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T14:32:36.915707Z

measured 103 of 103 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-31T18:28:55.336300Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-19T02:06:58.769990Z

Reference resolution

100 of 146 outbound references displayed

  • verified exact1
  • verified fuzzy17
  • unresolved78
  • parse uncertain4
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a7623565-8729-4681-a66c-db3503da4085 · outbound

This paper cites an unresolved cited work.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.626516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.626516Z digest=sha256:2ec1bac16b6c8eebf20b4ed8ae55507a6b84d047b77816e15f4f7cd46a075679

Observation c87b2a3c-41eb-4dfb-ac1e-e75e00c57c5a · outbound

This paper cites an unresolved cited work.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Unresolved cited work

Reference 2

Resolution
parse uncertain
no resolver link, observed 2026-08-09T14:32:36.630438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.630438Z digest=sha256:68d0614314cf0f4a47b33df3a81662f97b8547a92c0de5b04ed9d56ab1135370

Observation a3efb222-2be9-4a49-b967-a47dac57022c · outbound

This paper cites Aquarium dataset,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Aquarium dataset,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.633834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.633834Z digest=sha256:147e88701cd94c20ea1b0b374f529e4d71eb052aeb9e4122ea662825e3c7ddb9

Observation 8800c6c8-56ff-4aa8-a823-22f9e0836bda · outbound

This paper cites Hk reef fish Images.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Hk reef fish Images

Reference 6

Resolution
parse uncertain
no resolver link, observed 2026-08-09T14:32:36.637273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.637273Z digest=sha256:928d13ab082bec946b48ea9bf3711b406693bf1da0bbc3235771674f159fcdd2

Observation 94fa62e8-fe2e-4dab-9fde-1417a961572f · outbound

This paper cites Marine Animal Images,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Marine Animal Images,

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.640036Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.640036Z digest=sha256:2c65edece5b6752e52dcadbc5e018358901e95a5c75d90f56e717a23c3cb1272

Observation 23e42243-6f4a-4a70-a598-a95a63d4caf3 · outbound

This paper cites Sea Animals Image Dataset,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Sea Animals Image Dataset,

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.642906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.642906Z digest=sha256:f0b9ff6d54c0c9f4939fef92816bea66d8bafd27cd7b5eaa75b16e20dade7a9b

Observation c952f362-ade7-47d3-a003-d0d858e0164c · outbound

This paper cites Shutterstock Image.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Shutterstock Image

Reference 9

Resolution
parse uncertain
no resolver link, observed 2026-08-09T14:32:36.646014Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.646014Z digest=sha256:0e13d2a55703952f5d21e06958c7a5f4b6c7ab967d996568b25bfd897ce78c30

Observation 47a556ea-647a-4411-9271-1fa0bf902a6a · outbound

This paper cites Underwater trash detection dataset,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Underwater trash detection dataset,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.648670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.648670Z digest=sha256:91dd1b643eef103c070f71b0a0917e397028abb21aa916a1371f2078221d3181

Observation 180749ba-659e-41cc-90ee-97d79edf866e · outbound

This paper cites an unresolved cited work.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Unresolved cited work

Reference 11

Resolution
parse uncertain
no resolver link, observed 2026-08-09T14:32:36.651735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.651735Z digest=sha256:5ea05071e06a0d3c231e4cd54d4514fe241a0b7ba35d6480f480cb86d4652d04

Observation b8ccc24f-67eb-4e13-a3da-e4e649ade122 · outbound

This paper cites Ozfish dataset - machine learning dataset for baited remote underwater video stations,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Ozfish dataset - machine learning dataset for baited remote underwater video stations,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.654717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.654717Z digest=sha256:71a92099811be7f72ecf082757fbc536809041233c32b18041402609c707a51d

Observation 55668029-b596-45eb-a669-fa47922d02bb · outbound

This paper cites URPC dataset,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis URPC dataset,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.657477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.657477Z digest=sha256:ee9c06e0a785ad0b378d95ca32c80dcbdae20ba0016d375a20098319606341c6

Observation 51654ac3-bd56-4c84-97a1-2eb7f19ca817 · outbound

This paper cites Oceanic life dataset,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Oceanic life dataset,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.660289Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.660289Z digest=sha256:c382fcb5c1e1a2954c39b5f84a392694c5b8d9affa4a1e9c0932b79e3c504f50

Observation 1a73677d-6521-408f-9fa6-6a1e7973d005 · outbound

This paper cites A novel coral reef classification method combining radiative transfer model with deep learning,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A novel coral reef classification method combining radiative transfer model with deep learning,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.662643Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.662643Z digest=sha256:8700592b6467c4de398c60c8d0d63424b10e947635f2e0344c6c558dd5b2e555

Observation cec7effd-60be-4200-b6dc-9b7c8dbd6b91 · outbound

This paper cites Utb180: A high-quality benchmark for underwater tracking,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Utb180: A high-quality benchmark for underwater tracking,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.665444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.665444Z digest=sha256:193dad045abff5fa72c2cbef34cffa9411c5f057fd3b1084f95d5b9edd53a2e9

Observation 9300b776-b3d7-44e9-b2dd-a602e9963a90 · outbound

This paper cites Computer vision in aquaculture: a case study of juvenile fish counting,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Computer vision in aquaculture: a case study of juvenile fish counting,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.671749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.671749Z digest=sha256:7335555c6af36b3ccc33691238a3aa60515f123e9ff94e4426ea84dba25d76fb

Observation 2e1c90a1-044f-462f-aa73-69aa84ba5dbb · outbound

This paper cites BEiT: BERT Pre-Training of Image Transformers.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis BEiT: BERT Pre-Training of Image Transformers

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.674570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.674570Z digest=sha256:c4f174fe18ea39761900b2e9b0e776618671f96f9ae3dbc8a0423d3c9d5a4566

Observation bfcd744d-174f-40b8-b0a2-0931af034881 · outbound

This paper cites Deep learning for detection and counting of nephrops norvegicus from underwater videos,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Deep learning for detection and counting of nephrops norvegicus from underwater videos,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.677852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.677852Z digest=sha256:ccda1f7dad361438e316ece583d0f6c2fc1d4ddbfb0ff573faded80fc4c8ba9c

Observation 59fd532a-a257-45db-bfb0-2094e82de18a · outbound

This paper cites Semi-supervised visual tracking of marine animals using autonomous underwater vehicles,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Semi-supervised visual tracking of marine animals using autonomous underwater vehicles,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.680909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.680909Z digest=sha256:151c067692adab25e6d8831b3f43986028bb21827a43c0f6d10e1ebfdc53ce32

Observation 0b00b0e6-bfed-4e58-8d84-6149038bfb76 · outbound

This paper cites Emerging properties in self-supervised vision transformers,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Emerging properties in self-supervised vision transformers,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.683636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.683636Z digest=sha256:ecc28d49911e41171d140a3f909e6f41477b771601f257100734a84742244a70

Observation 348a7bb7-4057-4279-b001-1d827671b5c3 · outbound

This paper cites Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.686746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.686746Z digest=sha256:957393a88a321e6771ab22cdb8f9e68c6d4b56932e983376ae2db41882ce8520

Observation 0991f7f5-7d7d-441e-a956-30e4d119329c · outbound

This paper cites You only look one-level feature,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis You only look one-level feature,

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.689964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.689964Z digest=sha256:512f0eb65d5f89656a61b113a4105ef8e884c55789f6628508647460fa231b88

Observation b9717a93-9b5d-4982-aa5e-e08f42101cf9 · outbound

This paper cites A simple frame- work for contrastive learning of visual representations,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A simple frame- work for contrastive learning of visual representations,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.692992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.692992Z digest=sha256:9438f9856be4c86452c2bd9d92207b64c29b141bced954e75d5fb651d12a3e26

Observation 71baa9a0-4529-4d42-87d1-5c54eec0666b · outbound

This paper cites Masked-attention mask transformer for universal image segmenta- tion,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Masked-attention mask transformer for universal image segmenta- tion,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.696050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.696050Z digest=sha256:cbb0b6b0ec335265044c54698f379c9c3f87e1c8ec3bf7f2da69f9e7c100ad46

Observation 3b12c543-ff46-4d4c-b085-253b247f6969 · outbound

This paper cites Flow: A dataset and benchmark for floating waste detection in inland waters,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Flow: A dataset and benchmark for floating waste detection in inland waters,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.699016Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.699016Z digest=sha256:7252b1b477469ab38d95e2e2f859a94562ebace41b55d215c8ac582563322b7f

Observation 762cf6b8-571b-4312-bb0d-d0ba5db4837e · outbound

This paper cites Marine fouling images,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Marine fouling images,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.701853Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.701853Z digest=sha256:f90bb9961b45428d96233eaaf912d61e949df1e6795485f001a45c7a999a93a8

Observation 1a0e60f8-7863-401d-88f0-2ca8392e82ed · outbound

This paper cites Underwater image dehazing via unpaired image-to-image translation,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Underwater image dehazing via unpaired image-to-image translation,

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.704626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.704626Z digest=sha256:ffae3a912005504b1df60996fb5b24507d61d7a4ecc50496222edf55cdea7b8b

Observation a5f7111a-94d9-4800-9833-27d3853d5c9d · outbound

This paper cites Pdffigures 2.0: Mining figures from research papers,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Pdffigures 2.0: Mining figures from research papers,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.707293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.707293Z digest=sha256:3850902ee508afff5f2b6512726ec736363321ec25bd160ad7bbd1c7bff803f3

Observation 40c137d1-aeae-431c-aa46-f1fa105d62a6 · outbound

This paper cites Class-balanced loss based on effective number of samples,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Class-balanced loss based on effective number of samples,

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.710254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.710254Z digest=sha256:15ae4814cc37bbe6261fb774176d3773a60a6b782dbaeb42dc9f1d47b3db01b8

Observation 9a275941-10a9-4cbf-9abe-96618b519670 · outbound

This paper cites Ocean acidification’s impact on marine ecosystems,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Ocean acidification’s impact on marine ecosystems,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.713114Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.713114Z digest=sha256:19ea928245aac30131808a2c968ca818d4117c7eb7c6b11bbbbf600017b167f3

Observation 30c9fec3-b67a-4239-b902-4828e85cf336 · outbound

This paper cites Imagenet: A large-scale hierarchical image database,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Imagenet: A large-scale hierarchical image database,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.715962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.715962Z digest=sha256:78808ea04f729ed9391aedad1a04af1d563e58b6966e758850994c5e321ce26e

Observation de822310-ede3-49d6-8d53-e416f2129c37 · outbound

This paper cites Aquagan: Restoration of underwater images,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Aquagan: Restoration of underwater images,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.719199Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.719199Z digest=sha256:fddf3c8776b75c95c9fb074b409dc71ea857f8b05eeb9e5e5cc753d6b2a24bf6

Observation f20bf7a3-acd5-433d-b828-55399b798ec1 · outbound

This paper cites Corals classification,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Corals classification,

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.721905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.721905Z digest=sha256:8e0249cf0e5b162b06666dc5e65a0c31d558f62bff5b85f37642e1cfd236a5e0

Observation 500d7e85-c7da-46fb-bccc-f460c10e8b74 · outbound

This paper cites The wonders of coral reefs,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis The wonders of coral reefs,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.724884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.724884Z digest=sha256:1e15690408d55765149b31699683adcd5d533a983d2a964062fd0948b8fe5644

Observation 3f73a9a1-ac4e-44d1-be7d-045cc08ede7e · outbound

This paper cites Climate change impacts on marine ecosystems,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Climate change impacts on marine ecosystems,

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.727626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.727626Z digest=sha256:8e01fd07ebce01c16c1c2df5fc5cd59281dc9fa2919996ff395b341706f2d5bc

Observation 8c996df8-45d9-46c5-b76a-0ac86bcf5916 · outbound

This paper cites An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.730768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.730768Z digest=sha256:ee03117f9e78392b93c412a08bcd5a07ab984e77cc0faa4616968d8e4b3e3050

Observation a9323ed7-0784-46cb-9bef-39d7f192137d · outbound

This paper cites Rebuilding marine life,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Rebuilding marine life,

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.733726Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.733726Z digest=sha256:db00822cbece585e01bf99d46044565a597e1be7ec491044b689310f96aec9a7

Observation 1c9a36e0-c379-42d4-96ea-341af39a75ad · outbound

This paper cites The decline of australia’s great barrier reef,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis The decline of australia’s great barrier reef,

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.737018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.737018Z digest=sha256:745942621eaeb94d580d0aff5c75064fe0b61cd12c9a443016a1ea6d2c801b8a

Observation 18c1a540-400a-457f-847b-478fbbd01ab3 · outbound

This paper cites Instances as queries,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Instances as queries,

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.739889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.739889Z digest=sha256:017fa042d9782b6a2a6d42a4a67e09e9b96af112cb15c90e188a38d9eefff0f4

Observation c2d21c43-58da-4424-b42d-51fcb3a19cc0 · outbound

This paper cites Tood: Task- aligned one-stage object detection,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Tood: Task- aligned one-stage object detection,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.743121Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.743121Z digest=sha256:c688062feec62383a28386665ad19fa40e6e01e390e5af5b0fd06041f13acf68

Observation 426c4690-d77e-4913-8bf5-66fa5cd2f9b7 · outbound

This paper cites Robotic detection of marine litter using deep visual detection models,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Robotic detection of marine litter using deep visual detection models,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.745823Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.745823Z digest=sha256:5daa607c3198d2f0859bf3f2d1d904fff6796b1c38cc6341f2cc798f853757f5

Observation fcf42488-f30a-418e-b20f-b05f7e3f435b · outbound

This paper cites A Cookbook of Self-Supervised Learning.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A Cookbook of Self-Supervised Learning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.749163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.749163Z digest=sha256:d362080df6aa17bf4d60c6325dcda14045aaf9470d95968c1ddde86b87864e6d

Observation 56906724-5095-4515-97ee-a5e1c0b9833a · outbound

This paper cites A survey on underwater computer vision,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A survey on underwater computer vision,

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.753333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.753333Z digest=sha256:85614acd8d404d0c50697fad288aeb3bd61dcdf329c0875edd2adec3d5ab3eee

Observation 64137cee-7599-4a0d-b3f9-7b11abdcfca3 · outbound

This paper cites The mpa guide: A framework to achieve global goals for the ocean,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis The mpa guide: A framework to achieve global goals for the ocean,

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.756027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.756027Z digest=sha256:99fac607b439c0e72d29d91518d8bc91451a43ef1d7755931830f45f2f6a9746

Observation 90b4e61a-51b3-447e-b1f1-313bb1993b36 · outbound

This paper cites Coral species classification dataset,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Coral species classification dataset,

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.758696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.758696Z digest=sha256:b43576eb25ed7fd46f3c32b00c351cdf66863ea51fd16b89a9e1860826ab48ba

Observation 6bccf84c-7d08-4b99-8987-05a126d9f6ea · outbound

This paper cites MarineDet: Towards Open-Marine Object Detection.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis MarineDet: Towards Open-Marine Object Detection

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.761385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.761385Z digest=sha256:321794f39a4bf52b210fc612c63180fa9a8192d67de2b00ad57f5f26d8b93a57

Observation 316d164b-ad10-47d9-b40c-bed3483cfd47 · outbound

This paper cites A global map of human impact on marine ecosystems,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A global map of human impact on marine ecosystems,

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.764531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.764531Z digest=sha256:65190a25799aa58ef0f477f6a5f0fc5a90da22b7c93d18d24b7f69c6aa23a7f3

Observation bf34b609-6bc7-48bf-9cf9-defb93dbcd7e · outbound

This paper cites Umotma: Underwa- ter multiple object tracking with memory aggregation,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Umotma: Underwa- ter multiple object tracking with memory aggregation,

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.767425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.767425Z digest=sha256:2c6ba39fcf75406b9eb4f499167d28f15babf56cfa22d70d9f16cc122c9ccf52

Observation ab414238-5b81-4b92-8d95-736c377fa729 · outbound

This paper cites Deep residual learning for image recognition,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Deep residual learning for image recognition,

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.770140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.770140Z digest=sha256:e2113b8bb0310207645510706cb086aad777de413fd68d922840e6f2575f07e8

Observation 3d3b705d-0061-4f7d-b812-571a752517ca · outbound

This paper cites TrashCan: A Semantically-Segmented Dataset towards Visual Detection of Marine Debris.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis TrashCan: A Semantically-Segmented Dataset towards Visual Detection of Marine Debris

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.773388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.773388Z digest=sha256:34730f1c06611fbdd88b3540a3ef82b7861b17249f6ed77ebeea035f33e20fe3

Observation 3c9bbe8f-f382-452d-a73a-13757db85ea2 · outbound

This paper cites Usod10k: A new benchmark dataset for underwater salient object detection,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Usod10k: A new benchmark dataset for underwater salient object detection,

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.776525Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.776525Z digest=sha256:ae03e6f28ab9dd5fc644d202d5925dc3c924b9b061f21b3a7e53e7d1f7ffc57c

Observation c6671dfa-2c0e-4c4c-a11b-f2388cceea81 · outbound

This paper cites Underwater image restoration based on convolutional neural network,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Underwater image restoration based on convolutional neural network,

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.779115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.779115Z digest=sha256:eeb26bceb268a38dcb7fa01d4bc746604a9211193555435da8a11c10ecbab89d

Observation 03dd49a2-4348-491a-8aa9-0b077ea42aab · outbound

This paper cites Contrastive semi- supervised learning for underwater image restoration via reliable bank,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Contrastive semi- supervised learning for underwater image restoration via reliable bank,

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.782150Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.782150Z digest=sha256:b20514d32798a7adb2c157fdf967aad02c38b44fcb92003503aea1168627fffb

Observation 8f5e206a-6f99-42a6-9991-53923eb3721f · outbound

This paper cites Semantic Segmentation of Underwater Imagery: Dataset and Benchmark,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Semantic Segmentation of Underwater Imagery: Dataset and Benchmark,

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.784940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.784940Z digest=sha256:2a27600d63f124987e6bedc707023c65819d2e1812c0a4c0090894dad7581a49

Observation ccc5361a-80ca-4607-8f2c-59374c7800f5 · outbound

This paper cites Fast underwater image enhance- ment for improved visual perception,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Fast underwater image enhance- ment for improved visual perception,

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.787653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.787653Z digest=sha256:45aad9a8c2eb24f435b206cd50cb3bbdea35cd3b6749ecc1a1821ee6dddee8c2

Observation 911a9ecc-ba17-49e3-afc6-69e9564a74f5 · outbound

This paper cites Svam: Saliency-guided visual attention modeling by autonomous underwater robots,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Svam: Saliency-guided visual attention modeling by autonomous underwater robots,

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.790223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.790223Z digest=sha256:493ce9d09b556c1689bf203984a92152a068de82a622525e6b42d05e93aee581

Observation 9bce04d4-14b0-42fe-b087-e1923fbc736c · outbound

This paper cites Fish detection and species classification in underwater environments using deep learning with temporal information,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Fish detection and species classification in underwater environments using deep learning with temporal information,

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.792974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.792974Z digest=sha256:4e901f2e6000f9e3b3951357ea83007ea9b7e39351fccbcda13eaeaaca85e45e

Observation 1daeb3c8-5e51-4117-b49d-db6c4ef07798 · outbound

This paper cites The effects of fishing on marine ecosystems,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis The effects of fishing on marine ecosystems,

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.796011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.796011Z digest=sha256:61c2aec32b724d21efd0044b86fba214b0153785406fe4a8c936550c138de197

Observation d46d7758-5dd3-4068-84fd-193522080267 · outbound

This paper cites FathomNet: A global image database for enabling artificial intelligence in the ocean,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis FathomNet: A global image database for enabling artificial intelligence in the ocean,

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.798523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.798523Z digest=sha256:514a0ca30769d2176e31468e7e2abba577d70556a6f2e737238e2c4b0332f169

Observation 4a06a3c6-98bc-4e48-82c7-0cbeaf5f4520 · outbound

This paper cites The Fishnet Open Images Database: A Dataset for Fish Detection and Fine-Grained Categorization in Fisheries.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis The Fishnet Open Images Database: A Dataset for Fish Detection and Fine-Grained Categorization in Fisheries

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.801409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.801409Z digest=sha256:c6610d7ec13d2221c51667cc97d55212a4dc329bed53e884d03b1370951abcae

Observation b031326b-93e4-4d64-95f4-54c7ca229f19 · outbound

This paper cites Mask transfiner for high-quality instance segmentation,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Mask transfiner for high-quality instance segmentation,

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.804496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.804496Z digest=sha256:fadb2bd24a2e61f2b4d7b884092eff2eba51047949d8fc59f4ddecb1fd9c9a47

Observation e06573d6-d230-40f7-aa23-3b897fd40d43 · outbound

This paper cites Fishnet: A large- scale dataset and benchmark for fish recognition, detection, and func- tional trait prediction,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Fishnet: A large- scale dataset and benchmark for fish recognition, detection, and func- tional trait prediction,

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.807399Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.807399Z digest=sha256:962b73832a2dcf83c4e9b39b1aea1bd34ea2868ce84c6a638c86709445d2a54b

Observation 208094de-2ee8-4c8b-8ba8-3e7b0b5f4a67 · outbound

This paper cites Maple: Multi-modal prompt learning,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Maple: Multi-modal prompt learning,

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.810526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.810526Z digest=sha256:b3c1ea5e204e7e09819935d5f367195b5ad12687a8e620d23bf5c6af53c09846

Observation 3e16c40a-51be-44c6-b797-604099439eae · outbound

This paper cites Segment anything,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Segment anything,

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.813221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.813221Z digest=sha256:d0e4a0ce0145a1f2b657f19110c5ca4f5c1cb076d74a57b0691fdb489af2eaae

Observation 33eaf291-67a2-441d-afaa-bb022cd47266 · outbound

This paper cites Pointrend: Image segmentation as rendering,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Pointrend: Image segmentation as rendering,

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.815838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.815838Z digest=sha256:0dd38a804c0cc74ce4c8a9931d447032d9669d0b9478a3dfb833cbe55da7739f

Observation 4590d7d0-9482-4cec-8924-c946925a1efe · outbound

This paper cites Detection and tracking of underwater fish using the fair multi-object tracking model: A comparative analysis 28 of yolov5s and dla-34 backbone models,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Detection and tracking of underwater fish using the fair multi-object tracking model: A comparative analysis 28 of yolov5s and dla-34 backbone models,

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.819028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.819028Z digest=sha256:2913ca91be6cd408ce874aeb7e8d2926478d10b360a1587567a0a4dc6b755cbb

Observation 0dd826fd-eef8-4196-b5e1-c284d5881ce4 · outbound

This paper cites Watergan: Unsupervised generative network to enable real-time color correction of monocular underwater images,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Watergan: Unsupervised generative network to enable real-time color correction of monocular underwater images,

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.821852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.821852Z digest=sha256:6bf0f6c058d7b3aaa306633596a53a4053b23d8de200495d1ebdafb19118c534

Observation a9709e53-7887-4d09-b06f-088c6e232839 · outbound

This paper cites Deep learning for visual recognition and detection of aquatic animals: A review,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Deep learning for visual recognition and detection of aquatic animals: A review,

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.824430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.824430Z digest=sha256:a1b8486889c32bb3e10b3d67615c695182d5f9550bc22f54ea22d17e8d6aecf3

Observation 73459cd0-2871-4342-b7f5-17a21c1029e8 · outbound

This paper cites Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.827013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.827013Z digest=sha256:4b0d84fc502f03232ca43549e97a4ec8de5b28b095baa84208ceccf151597a56

Observation 28464894-6440-4b66-ba4b-6d739362e442 · outbound

This paper cites Citetracker: Correlating image and text for visual tracking,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Citetracker: Correlating image and text for visual tracking,

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.829761Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.829761Z digest=sha256:5fc2ecb74d7d0752a7876a0875c546cd670e65879f505dd67b15b31c632cf049

Observation 1af0c70c-95e4-4bc5-ae4f-476ff02b4339 · outbound

This paper cites Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.832435Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.832435Z digest=sha256:91b4111d61efbf4de59d241d0e6a4805b210adb82927423c10e6f738fc4130bc

Observation d2eba434-bde2-4ebd-916a-022a565d7df7 · outbound

This paper cites Underwater object tracker: Uostrack for marine organism grasping of underwater vehicles,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Underwater object tracker: Uostrack for marine organism grasping of underwater vehicles,

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.835426Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.835426Z digest=sha256:779c3a94c16da53fcc97493c6444fb2c3b4c9fe993b24c7295549beb45894343

Observation f0f2188d-ac82-419c-b871-b5adb2d117e5 · outbound

This paper cites Watermask: Instance segmentation for underwater imagery,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Watermask: Instance segmentation for underwater imagery,

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.837946Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.837946Z digest=sha256:81ca4092e21759a3e482d2970623bab9a29e3bcbfcaf467df33deb62c634e21a

Observation c4a48a4b-95c6-419c-9c52-1d2d897fd228 · outbound

This paper cites An end-to-end transformer model for crowd localization,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis An end-to-end transformer model for crowd localization,

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.840987Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.840987Z digest=sha256:1f60cdcf57f03e231edb10a7cfcfda3f01d3cc380e5c13bbca39e085a55bfb47

Observation 1a87815a-f789-40f2-96dc-9a69d893d544 · outbound

This paper cites Focal loss for dense object detection,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Focal loss for dense object detection,

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.843537Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.843537Z digest=sha256:d13e8e9d7449ed0003a21de5b508aa1d81e0504e53e226696c73023174e889bf

Observation 19a79aa2-3491-40b8-bd43-a8a2826cd236 · outbound

This paper cites Microsoft coco: Common objects in context,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Microsoft coco: Common objects in context,

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.846217Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.846217Z digest=sha256:93c70e6aa366813a25fac66e9e4c3e9607bbbf185075792e67bfa0e1eb6a7a0a

Observation 7723e8b4-d64e-4a59-9944-8b999e9e2755 · outbound

This paper cites A new dataset, poisson gan and aquanet for underwater object grabbing,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A new dataset, poisson gan and aquanet for underwater object grabbing,

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.093642Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.848549Z digest=sha256:1ada96e34024b24b39f1309b29e1914bfcce2929f11b31c8ed4ee874df3aa8a6

Observation 7acd1826-3099-4266-86c2-f367c95665c5 · outbound

This paper cites Cffi-vit: Enhanced vision transformer for the accurate classification of fish feeding intensity in aquaculture,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Cffi-vit: Enhanced vision transformer for the accurate classification of fish feeding intensity in aquaculture,

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.084785Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.850991Z digest=sha256:6c571c6f5990336c9472acd13e4c55ebc82df3c83adc357564f130055fcb8698

Observation 6bcf1e9c-644e-493f-81a6-b56f53836847 · outbound

This paper cites Dp-fishnet: Dual-path pyramid vision transformer-based underwater fish detection network,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Dp-fishnet: Dual-path pyramid vision transformer-based underwater fish detection network,

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.077140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.853552Z digest=sha256:cee95bbbbe7228a6ce4c35855a3a3dee34ba150bd30ba8546c36e692ea611013

Observation ca511ec4-e457-4f88-9d7a-789a3aedf3ae · outbound

This paper cites A convnet for the 2020s,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A convnet for the 2020s,

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.856470Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.856470Z digest=sha256:dabfbc807e41fbf78fd6e500fcfc19d2e464b03b808fb0945070a1025960ddee

Observation acd1329e-dddb-4ea0-aa59-f6279af9f167 · outbound

This paper cites Decoupled Weight Decay Regularization.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Decoupled Weight Decay Regularization

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.858811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.858811Z digest=sha256:2b0569ae3e5c0bcfb6c5d52db38f8f03d3327c11e297abd9d2ccb67826c1945a

Observation 069660ee-76e8-4e92-afab-4079bd8575b7 · outbound

This paper cites Multi-scale adversarial network for underwater image restoration,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Multi-scale adversarial network for underwater image restoration,

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.064575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.861944Z digest=sha256:aa9fed3206a0c50808ba2b6b4bdd750fd98b19a3dc31b03bdd800531996b1854

Observation 51d646f3-3c80-4d0c-a80a-21494bf11e9d · outbound

This paper cites Enhancing clip with gpt-4: Harnessing visual de- scriptions as prompts,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Enhancing clip with gpt-4: Harnessing visual de- scriptions as prompts,

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.056746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.864764Z digest=sha256:451cd1d382a53d316e40629f7064aa7479b101a98d9549bfed8b142436f94789

Observation b04fd5dc-3c7c-4844-a807-10f71e41747e · outbound

This paper cites Australasian freshwater fish faunas: diversity, interrela- tionships, radiations and conservation,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Australasian freshwater fish faunas: diversity, interrela- tionships, radiations and conservation,

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.048317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.867519Z digest=sha256:396e12e206aa0d98b97b09d85f172e58c705e7a4cb029dd3688a1780b722b48d

Observation 4796e597-07a3-4eef-8652-e6fc2eacf5a7 · outbound

This paper cites The rich biodiversity of ocean ecosystems,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis The rich biodiversity of ocean ecosystems,

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.039272Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.870239Z digest=sha256:9fbb59d172abf341bb3666f29ee23e949f5eee29068d60f1474edf8af1223482

Observation 33ac7f0a-4366-473a-8b13-52a3a1997867 · outbound

This paper cites Coral identification and counting with an autonomous underwater vehicle,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Coral identification and counting with an autonomous underwater vehicle,

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.030196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.873073Z digest=sha256:d25e56e28758a0bf0f5ab5e0858dbaf56fbcf6b992fca436b19b109439810a39

Observation 3b6459ab-5ff4-4b4a-8fd5-fb4df344f9ea · outbound

This paper cites Innovative approaches to coral conservation,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Innovative approaches to coral conservation,

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.020750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.875777Z digest=sha256:51736efca8922db187aafaea29b19a028c859e2260b8670458158e91649757d4

Observation e932bc13-e4fd-4df5-8bfc-7260d0bddea8 · outbound

This paper cites Embodiedgpt: Vision-language pre-training via embodied chain of thought,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Embodiedgpt: Vision-language pre-training via embodied chain of thought,

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.878540Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.878540Z digest=sha256:049aa7e65106ed0ebee011673323bbfc1b585cb4ea8bf81a7257337b69918d14

Observation 880b1daf-c74c-43d9-b6c6-5a159c22f79a · outbound

This paper cites I2mvformer: Large language model generated multi-view document supervision for zero-shot image clas- sification,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis I2mvformer: Large language model generated multi-view document supervision for zero-shot image clas- sification,

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:38.006804Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.881512Z digest=sha256:1c684587979377729b47a3d12c8bae109755f35006481b1d749e5880fc058330

Observation 7b9ef932-39d9-4c42-b4f1-ce53034e8268 · outbound

This paper cites Dinov2: Learning robust visual features without supervision,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Dinov2: Learning robust visual features without supervision,

Reference 92

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.997871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.884725Z digest=sha256:c948e875fc7188140635d40988bdbc2e755abfef592245fe58965f607a64f5b7

Observation 9b5108d4-f5ba-40b2-91c2-12858626e74a · outbound

This paper cites Comprehensive underwater object tracking benchmark dataset and underwater image enhancement with gan,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Comprehensive underwater object tracking benchmark dataset and underwater image enhancement with gan,

Reference 93

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.989347Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.887504Z digest=sha256:03fe127baf4e79af98d192b2638109461009efc8dadd31c4876ce77579332e09

Observation 7422b08a-c12e-4521-991a-55f6ad7018cc · outbound

This paper cites Detection of marine animals in a new underwater dataset with varying visibility,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Detection of marine animals in a new underwater dataset with varying visibility,

Reference 94

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.979823Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.890340Z digest=sha256:dd5345133a7b72c69dae817aa2a63c05d589449838095a0f8a009984d9e642fb

Observation 49d56bc5-c136-481f-8bcd-511227916225 · outbound

This paper cites U-shape transformer for underwater image enhancement,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis U-shape transformer for underwater image enhancement,

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.970732Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.893275Z digest=sha256:9b1c32ad57787c72ec87800bc9e84d1c1e881393226a50815bc7dc424edddde9

Observation 69fe3a9a-a28d-4d8b-bcc0-4ddb767773cf · outbound

This paper cites Detecting and recognizing marine animals using advanced deep learning models,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Detecting and recognizing marine animals using advanced deep learning models,

Reference 96

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.961600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.895935Z digest=sha256:0dcaff3893503b883858c625f60d8915b74830491a76cffa8113a89cbcab5032

Observation 6a27b01f-f93c-49ed-bc56-1dab46adf87e · outbound

This paper cites Learning transferable visual models from natural language supervision,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Learning transferable visual models from natural language supervision,

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.898402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.898402Z digest=sha256:e2a65d7451c7615f4ede0968178dba5d18869ffd03c9176044cf850139bc35a5

Observation 90e98c48-440b-4ba3-9e18-60c09a5ef48b · outbound

This paper cites Language models are unsupervised multitask learners,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Language models are unsupervised multitask learners,

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.901178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.901178Z digest=sha256:4e3885e8cbf815c202d432b20f0d4504971c992615279d4aa9287d6af49d994f

Observation 5b3c42de-8b8f-4b57-95b4-8fa6b4b82b2b · outbound

This paper cites Faster r-cnn: Towards real-time object detection with region proposal networks,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Faster r-cnn: Towards real-time object detection with region proposal networks,

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.903871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.903871Z digest=sha256:aac84113904169bd163e8d575951fe4e2c291a594d8899835f02dd946aaa92f0

Observation a51dc73d-938a-41d6-9c5e-f8e34eb545cd · outbound

This paper cites A realistic fish-habitat dataset to evaluate algorithms for underwater visual analysis,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis A realistic fish-habitat dataset to evaluate algorithms for underwater visual analysis,

Reference 100

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.937123Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.906899Z digest=sha256:b7b48a92525e0601758aa23ccde80de9fb31e521646a0ef38009511377250aeb

Observation bf59f670-0f08-411c-aaff-d07bae9af006 · outbound

This paper cites Overcoming Annotation Bottlenecks in Underwater Fish Segmentation: A Robust Self-Supervised Learning Approach.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Overcoming Annotation Bottlenecks in Underwater Fish Segmentation: A Robust Self-Supervised Learning Approach

Reference 101

Resolution
verified exact
local_arxiv, observed 2026-08-09T14:32:37.293130Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.909779Z digest=sha256:83216fa6f626f0c55f3f07e76050450af950434dff37f8abbd2e122b3e2e4d61

Observation 207e0873-07df-4895-bb9d-5c84d536270f · outbound

This paper cites Computer vision and deep learning for fish classification in underwater habitats: A survey,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Computer vision and deep learning for fish classification in underwater habitats: A survey,

Reference 102

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:32:37.927506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T14:32:36.913016Z digest=sha256:415eafc093559a92ee166aca46a36cf8f2ed2c624c9bd2a333336f523c80f3fb

Observation 025d8646-f340-4a52-8d95-994acbff08a1 · outbound

This paper cites Nlx-gpt: A model for natural language explanations in vision and vision-language tasks,.

AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis Nlx-gpt: A model for natural language explanations in vision and vision-language tasks,

Reference 103

Resolution
unresolved
no resolver link, observed 2026-08-09T14:32:36.915707Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:32:36.915707Z digest=sha256:a4de788dcb0d0fd4cc3a23cb450fad9e316f4f75144f4956bbd812828d49f1dd

Pith citing papers

Observation 835b0549-c4ff-4923-99f6-cd84e49684ec · inbound

AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock cites this paper.

AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-19T02:06:58.772657Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-19T02:03:46.331803Z digest=sha256:e467dee4f644d346ef56dec55d9cbbe65660bb1e34376fb6eef2e7f0352a2c02

Observation 3e79eda9-a4fc-43ff-abde-a0ccd1ac9cae · inbound

Label-efficient underwater species classification with logistic regression on frozen foundation model embeddings cites this paper.

Label-efficient underwater species classification with logistic regression on frozen foundation model embeddings AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-11T22:51:23.115841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-08T02:19:09.609298Z digest=sha256:286cca3807929d459db339818340359d60de97cdf85ff7a8beb76243a4d44dc8

Observation 3f1cd8d7-5200-4278-aef5-7452f7ab6fd0 · inbound

Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG cites this paper.

Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG AquaticCLIP: A Vision-Language Foundation Model for Underwater Scene Analysis

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-31T18:28:55.336300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T18:28:55.336300Z digest=sha256:d9aca2acfb2680db4de5aae67bc16761ee418df49729f75bbd424f8648c34560