{"as_of":"2026-08-13T05:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:509470cb341d1ea8583b2188c4bcdd86bcc7b65272b63ec8333aab869ac28975","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:41:41.515573Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:08:58.050673Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T21:08:58.212497Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"cited_work":{"arxiv_id":"2412.02262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02262","snapshot_observed_at":"2026-08-10T21:08:58.212497Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","venue":"cs.CV","work_id":"2f72992e-b3ba-40de-95e7-25bd553e66b6","year":2024},"citing_paper":{"arxiv_id":"2501.06277","last_updated":"2025-01-10T12:48:29Z","snapshot_observed_at":"2026-08-12T05:09:38.806331Z","submitted_at":"2025-01-10T12:48:29Z","title":"Environmental large language model Evaluation (ELLE) dataset: A Benchmark for Evaluating Generative AI applications in Eco-environment Domain","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T21:08:58.050673Z"},"links":{"cited_paper":"/paper/2412.02262","citing_paper":"/paper/2501.06277"},"observation_digest":"sha256:918187844ad749c52fd2d6832ca95732865d3e8d9545fe753c75d7085b0a4ace","observation_id":"c067fa4c-c462-4a07-b63b-423631a37309","resolution":{"observed_at":"2026-08-10T21:08:58.219723Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.02262/citation-record","integrity":"/paper/2412.02262/integrity","json":"/paper/2412.02262/citation-record.json","paper":"/paper/2412.02262"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:41.307801Z","title":"Wild salmon enumeration and monitoring using deep learning empow- ered detection and tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.307801Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:c931081bfa4733f818d65a0e8b0ddd0462f872a1521793db4d8543444c426cfd","observation_id":"29b320c0-d0ae-48dd-b7d2-af8f30e2480c","resolution":{"observed_at":"2026-08-11T23:41:41.307801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15406","last_updated":"2024-05-22T07:15:18Z","snapshot_observed_at":"2026-08-13T00:23:34.497384Z","submitted_at":"2024-04-23T18:00:09Z","title":"Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15406","snapshot_observed_at":"2026-08-11T23:41:41.316085Z","title":"Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Mul- timodal LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.316085Z"},"links":{"cited_paper":"/paper/2404.15406","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:10927776d3180c99a9e9ef5e2055b4b1f0d096ada3aaf815c4c085909616edea","observation_id":"5e6bbc10-6c55-4375-a10d-d356830a6be0","resolution":{"observed_at":"2026-08-11T23:41:41.316085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:42.781354Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recogni- tion at Scale","venue":null,"work_id":"ee4e5715-d506-4ec5-a37e-d2c29bae53c5","year":2020},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.329852Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:6e877e886afb45800f7673bbae84de7d098fe675d0997605cfcb6ab66dfbe065","observation_id":"8bb92a7c-af3d-405c-ad44-385ac67d098b","resolution":{"observed_at":"2026-08-11T23:41:42.791378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:42.759967Z","title":"Knowledge Augmented Instruction Tuning for Zero-shot Animal Species Recognition","venue":null,"work_id":"5476a3c5-1500-4f60-8db8-7a195d61440e","year":2023},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.336052Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:5c07aca6fbc8a64e229d4fdd182b9b9ece05304bb7cbe694505ee90391ea14d6","observation_id":"d48afad5-34ad-4bda-99b6-4f6c30e29f1a","resolution":{"observed_at":"2026-08-11T23:41:42.767809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:42.741656Z","title":"Joint SDG Fund | Goal 14: Life below water","venue":null,"work_id":"4e117fbd-8021-4701-89ba-d00d7bc15e5d","year":null},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.341976Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:d6dfa8589728767213871ead760623bb4a3410893867e46f224e2494514aebae","observation_id":"67d7ca62-2d10-4680-9ecc-073068561787","resolution":{"observed_at":"2026-08-11T23:41:42.747194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08909","last_updated":"2020-02-10T18:40:59Z","snapshot_observed_at":"2026-08-02T17:52:27.326803Z","submitted_at":"2020-02-10T18:40:59Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08909","snapshot_observed_at":"2026-08-11T23:41:41.348366Z","title":"REALM: Retrieval-Augmented Language Model Pre-Training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.348366Z"},"links":{"cited_paper":"/paper/2002.08909","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:b9f2336934ca60b3a2bc87da92f1622abfa99b8eaa053159369b17f3209e084b","observation_id":"aeee8331-6626-4a1d-8d8f-8795f07f70cd","resolution":{"observed_at":"2026-08-11T23:41:41.348366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-11T23:41:41.354741Z","title":"Deep Residual Learning for Image Recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.354741Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:3f48bc7087934000806f652939c57893e683d86b3a7b7ca334e1a4694131a289","observation_id":"d30c9162-2cd7-4f31-922f-374e61a06702","resolution":{"observed_at":"2026-08-11T23:41:41.354741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T23:41:41.362035Z","title":"Hu et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.362035Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:ddabc21bbfe995c1f0470bc4aaa4097cea69463f8e60ef76e6640003141d2063","observation_id":"f0e327bb-4f50-41b1-966a-f9be952974be","resolution":{"observed_at":"2026-08-11T23:41:41.362035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05221","last_updated":"2023-04-03T08:32:39Z","snapshot_observed_at":"2026-08-03T16:32:45.929187Z","submitted_at":"2022-12-10T06:17:56Z","title":"REVEAL: Retrieval-Augmented Visual-Language Pre-Training with Multi-Source Multimodal Knowledge Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05221","snapshot_observed_at":"2026-08-11T23:41:41.370174Z","title":"REVEAL: Retrieval-Augmented Visual-Language Pre-Training with Multi- Source Multimodal Knowledge Memory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.370174Z"},"links":{"cited_paper":"/paper/2212.05221","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:d73783329a7a9aa269027d64f727b93f33a8920d1480f9fcf456f6110750947e","observation_id":"f84ed92c-1b3a-4a48-bbb4-cb680dde8698","resolution":{"observed_at":"2026-08-11T23:41:41.370174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06983","last_updated":"2023-10-22T00:11:13Z","snapshot_observed_at":"2026-07-06T15:26:06.998516Z","submitted_at":"2023-05-11T17:13:40Z","title":"Active Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06983","snapshot_observed_at":"2026-08-11T23:41:41.377215Z","title":"Active Retrieval Augmented Generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.377215Z"},"links":{"cited_paper":"/paper/2305.06983","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:b0fa2f40fb6d9da7bb932e2295e6f0c3224285c72e6843addb19d805c08d3f5f","observation_id":"ebef789a-774d-4c7b-9bdb-8ac6685034a8","resolution":{"observed_at":"2026-08-11T23:41:41.377215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:42.720942Z","title":"FathomNet: A global image database for enabling artificial intelligence in the ocean","venue":null,"work_id":"e4981a08-0a02-46fa-91b6-3fba18c88edf","year":2022},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.383031Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:35d03904954a8a01b1fea1ba6b35696fd39f57cb12799fd3e2491ff13559daf9","observation_id":"02567d19-32f8-421f-8c00-144407b67629","resolution":{"observed_at":"2026-08-11T23:41:42.727632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09178","last_updated":"2021-06-16T23:53:18Z","snapshot_observed_at":"2026-08-04T06:57:44.202338Z","submitted_at":"2021-06-16T23:53:18Z","title":"The Fishnet Open Images Database: A Dataset for Fish Detection and Fine-Grained Categorization in Fisheries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09178","snapshot_observed_at":"2026-08-11T23:41:41.396405Z","title":"The Fishnet Open Images Database: A Dataset for Fish Detec- tion and Fine-Grained Categorization in Fisheries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.396405Z"},"links":{"cited_paper":"/paper/2106.09178","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:18fe4b4e1fe7dcf1761a91f5db7e88db9c7ece02ff5f75b58b8a58c815acdcd4","observation_id":"fc83bae2-e79c-479d-b7e2-898892a1590c","resolution":{"observed_at":"2026-08-11T23:41:41.396405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:42.701914Z","title":"ImageNet Classification with Deep Convolutional Neural Networks","venue":null,"work_id":"3cc91e67-012b-458c-82d5-24e6e2f7e284","year":2012},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.404767Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:81f4118231f1fbcd0f0b90687932db8e3b09c55a0a5bbab44aa07efa92461cd1","observation_id":"539593de-eb52-497f-b5b7-a67952e93b5b","resolution":{"observed_at":"2026-08-11T23:41:42.708274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-11T23:41:41.411781Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.411781Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:74c2eb031e0da3c480060bfb0614677f63adf9ed61b950de29906ddf6b584669","observation_id":"a72b9a4c-ce03-451d-b5d1-16ecc87e5e16","resolution":{"observed_at":"2026-08-11T23:41:41.411781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/9879567","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:42.353108Z","title":"Grounded Language-Image Pre-training","venue":null,"work_id":"b67cf494-16d2-41a3-9874-9b7cf11ad72c","year":2022},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.417891Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:9feb2daa96349898312a14f6803d054762a1ce160fcfe9a863f8c82055ac27b0","observation_id":"ac06c90b-220c-4922-bf3e-5aef7eb10c32","resolution":{"observed_at":"2026-08-11T23:41:42.361860Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T23:41:41.424916Z","title":"Visual Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.424916Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:f6d0f7560bdc6bbc4ce0b1017e73e2b9e1f3a3859f30cb65e7fcf3aec125a720","observation_id":"0076c009-5bf5-4e80-a9b4-351baf72c9a3","resolution":{"observed_at":"2026-08-11T23:41:41.424916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/9577534","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:42.248016Z","title":"KRISP: Integrating Implicit and Symbolic Knowledge for Open- Domain Knowledge-Based VQA","venue":null,"work_id":"c6cb7153-3a77-4bda-bb81-f47ca900c529","year":2021},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.431235Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:1154b50c5f2d749a25463d88d682e43fdac5acf56d94eb841a92d02a27f1c37a","observation_id":"af48f09c-8a81-4ec3-a30d-b8f6c070f987","resolution":{"observed_at":"2026-08-11T23:41:42.257825Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/8953725","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:42.162663Z","title":"OK-VQA: A Visual Question Answering Benchmark Requiring Exter- nal Knowledge","venue":null,"work_id":"883ad69b-a5bf-4b56-ab97-d5cbf0938d32","year":2019},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.437294Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:cdcde4abc5add46f19875f86bccb09caed0ecbf3b9b62d12306e93b04706c824","observation_id":"b7cc8d75-a0ac-4c2b-a3a5-21f9578f77a9","resolution":{"observed_at":"2026-08-11T23:41:42.171880Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:42.682898Z","title":"New frontiers in AI for biodiversity research and conservation with multimodal language models","venue":null,"work_id":"e265313c-7561-4e9b-833b-34b44a80a766","year":2024},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.442750Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:912fe9bc7ee5d570a4151b31f9b4b2544b3e444cb25f6db2ca70e1080a926428","observation_id":"3c2bd38b-8bee-4502-87b0-2599141d6b49","resolution":{"observed_at":"2026-08-11T23:41:42.689102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09716","last_updated":"2019-10-22T01:03:33Z","snapshot_observed_at":"2026-08-01T18:32:21.990097Z","submitted_at":"2019-10-22T01:03:33Z","title":"A deep active learning system for species identification and counting in camera trap images","version":1},"cited_work":{"arxiv_id":"1910.09716","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.09716","snapshot_observed_at":"2026-08-11T23:41:42.064654Z","title":"A deep active learning system for species identification and counting in camera trap images","venue":"cs.LG","work_id":"1ba39d00-df29-432a-a147-2e0668c8d0d7","year":2019},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.449340Z"},"links":{"cited_paper":"/paper/1910.09716","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:6cc5a9ec1c9c456c8f061289ab8fb5efca0801857d70959b7789894f7aad0361","observation_id":"5358996d-cb21-480c-a9a1-87b151644736","resolution":{"observed_at":"2026-08-11T23:41:42.070193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:41.457182Z","title":"Automatically identifying, counting, and describing wild animals in camera-trap images with deep learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.457182Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:537f8c7b20c4f233f34be73f553338dd2a2dca99e7ed4ec6f2cd324ee2b9c8ad","observation_id":"ffb93696-6913-4a47-8ed8-a1dae51f9936","resolution":{"observed_at":"2026-08-11T23:41:41.457182Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:42.662012Z","title":"Learning Transferable Visual Models From Natural Language Supervi- sion","venue":null,"work_id":"325faea4-b412-4c4b-adad-b2f54bfab2e0","year":2021},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.462361Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:400ebcd1e2ad8539f57c62a44c7443aa6a941ac9bf12fc50643ba8ac623e7fa6","observation_id":"7a972156-5d2a-478c-9caf-1dd21b047f55","resolution":{"observed_at":"2026-08-11T23:41:42.668802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15323","last_updated":"2023-03-28T12:04:49Z","snapshot_observed_at":"2026-08-13T00:30:45.824752Z","submitted_at":"2022-09-30T09:03:22Z","title":"SmallCap: Lightweight Image Captioning Prompted with Retrieval Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15323","snapshot_observed_at":"2026-08-11T23:41:41.467754Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.467754Z"},"links":{"cited_paper":"/paper/2209.15323","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:71291f4c7051252dd791c4ba5e998c03b5f6faebb15d65740613f80be37d212c","observation_id":"5ee30694-4b65-4bcf-b469-e2cc1dbe3124","resolution":{"observed_at":"2026-08-11T23:41:41.467754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:41.475227Z","title":"You Only Look Once: Unified, Real-Time Object Detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.475227Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:1f1c7eabcf80264a8a14cea640f99cba7a97e60989ec57e578aac4bf7c49e149","observation_id":"4e4456c4-02a9-4c53-8876-89ce403ecf11","resolution":{"observed_at":"2026-08-11T23:41:41.475227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.13162","last_updated":"2022-08-22T07:52:34Z","snapshot_observed_at":"2026-08-12T14:29:52.330980Z","submitted_at":"2022-07-26T19:35:49Z","title":"Retrieval-Augmented Transformer for Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.13162","snapshot_observed_at":"2026-08-11T23:41:41.481605Z","title":"Retrieval-Augmented Transformer for Image Captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.481605Z"},"links":{"cited_paper":"/paper/2207.13162","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:a1c354b364dcf6e25eb62c63e0daa0deb732866e09b8204104c4c5510951f1e0","observation_id":"444c47a0-07fa-433b-877c-f53d199ab57c","resolution":{"observed_at":"2026-08-11T23:41:41.481605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:42.641603Z","title":"K-LITE: Learning Transferable Visual Models with External Knowl- edge","venue":null,"work_id":"c759d349-a803-49d3-ae1e-16182dd15e2f","year":2022},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.487228Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:07e3ebf724e450fce9705ec75450f000d6b96791faf85a479bf988d82abc6128","observation_id":"67858487-0c8c-4611-af1d-7a4d38a671b3","resolution":{"observed_at":"2026-08-11T23:41:42.647250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:42.624230Z","title":"BioCLIP: A Vision Foundation Model for the Tree of Life","venue":null,"work_id":"6b1d8891-84f6-4a38-b685-8ce8fdf6105f","year":2024},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.492660Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:7500e31e9757b8c6c1bb9d4d0bbc07dd62f36f8e3f75b1c26322b2dfcd3876b4","observation_id":"f2b0088a-0b81-4756-829a-cacbfd8a1cb6","resolution":{"observed_at":"2026-08-11T23:41:42.629866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/8579012","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:41.883009Z","title":"The iNaturalist Species Classification and Detection Dataset","venue":null,"work_id":"58f56d76-fdc5-40b6-bbd2-b66238fb15b5","year":2018},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.497528Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:0b1985435aa43a1df82b9daf2e9db4bd3453ad69139d67f652f6a82760ac9e37","observation_id":"b819b07f-d332-4c90-8e8d-9dbbf9d32e74","resolution":{"observed_at":"2026-08-11T23:41:41.895892Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/icesjms/fsae118/7742959","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:41.562468Z","title":"Advancing artificial intelligence in fisheries requires novel cross-sector collaborations","venue":null,"work_id":"ec4f9cc7-bf00-4fe0-8b72-de0f34c76caf","year":2024},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.505489Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:cc211d7a3afae483f3f78e3f80355fa40c8e11e7beb30b403c197dfebb3492e7","observation_id":"9185048f-4e26-452c-b128-e2fcc4df740f","resolution":{"observed_at":"2026-08-11T23:41:41.575579Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.12248","last_updated":"2021-12-14T01:17:03Z","snapshot_observed_at":"2026-07-06T10:52:22.548376Z","submitted_at":"2021-03-23T00:49:36Z","title":"Multi-Modal Answer Validation for Knowledge-Based VQA","version":3},"cited_work":{"arxiv_id":"2103.12248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.12248","snapshot_observed_at":"2026-08-11T23:41:41.794388Z","title":"Multi-Modal Answer Validation for Knowledge-Based VQA","venue":"cs.CV","work_id":"a43c956b-3acd-484c-a6f3-32b6a9a64f6e","year":2021},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.510815Z"},"links":{"cited_paper":"/paper/2103.12248","citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:8f2fe7d3cd8f5a32d1f6e7c79f39926b6aa5024274b1b313d628f690de846601","observation_id":"430791f0-3760-4813-a2f7-4a52502f63b4","resolution":{"observed_at":"2026-08-11T23:41:41.800943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/7780940","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:41:41.763179Z","title":"MSR-VTT: A Large Video Description Dataset for Bridging Video and Lan- guage","venue":null,"work_id":"0d4079b2-09c7-4e87-ac17-dc52f6257a96","year":2016},"citing_paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T23:41:41.515573Z"},"links":{"citing_paper":"/paper/2412.02262"},"observation_digest":"sha256:83e173561c1381587172f5d2e824037c1f52490ec404f333167247b43f6cc24d","observation_id":"a537c598-4f1f-48b1-9fd1-d6447bc5d05f","resolution":{"observed_at":"2026-08-11T23:41:41.774782Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.02262","last_updated":"2024-12-03T08:34:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T05:10:20.023157Z","submitted_at":"2024-12-03T08:34:42Z","title":"Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":8,"verified_fuzzy":9},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2412.02262."}