{"as_of":"2026-08-09T12:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5dd0fa14f8fc4c253c952ae0d4e4a7af0338d9f8bdf0db4b3f1e0c08736b9ae1","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:10:30.674790Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24064/citation-record","integrity":"/paper/2607.24064/integrity","json":"/paper/2607.24064/citation-record.json","paper":"/paper/2607.24064"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:21.406126Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:21.406126Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:4b15e7de48da42514ba1ed91db27cdf799635fc68319fa86c12fb054807df05f","observation_id":"891bdaee-79f3-4914-bacb-67eaf34bfeff","resolution":{"observed_at":"2026-07-31T23:10:21.406126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:21.590960Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:21.590960Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:ba53879234868a463d27615498f939eabf5e65c3508bfeb19784fa6d6aad7394","observation_id":"b9c44663-7a80-488c-9692-94a67be67804","resolution":{"observed_at":"2026-07-31T23:10:21.590960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:21.726534Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:21.726534Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:7e1114cc9699aec3c1a058f26ca29f22e257c4d91efaa3e84269edcc96550fc7","observation_id":"86d3f71c-3a51-46f5-ba32-a272ae51ea5c","resolution":{"observed_at":"2026-07-31T23:10:21.726534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:21.852941Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:21.852941Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:56cc92413d8658bbc514b64dfc400a965f276930df12ff1bb43018b7ad3a041b","observation_id":"1dc4f065-5730-438d-8c84-fc50633515d3","resolution":{"observed_at":"2026-07-31T23:10:21.852941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:21.962785Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:21.962785Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:4ae4f180979029353f06490f898bc82687763df0c65a0307c56a3cda067972bb","observation_id":"bea9406a-9014-4a2a-a5fd-8fb860a75cfa","resolution":{"observed_at":"2026-07-31T23:10:21.962785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:22.067319Z","title":"In: ACCV (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:22.067319Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:d60f6d407408c35072fb037df84fbb1ef1b252ea891f9c6ba2b1d00436b4ee55","observation_id":"d7dda74b-d0d6-4550-b703-e678ce371218","resolution":{"observed_at":"2026-07-31T23:10:22.067319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-31T23:10:22.222243Z","title":"arXiv preprint arXiv:2308.12966 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:22.222243Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:50942a23c9d7638339e59761bcb885624da047b19aa2deeb080b430b2bd77dfa","observation_id":"ff26d6fe-6795-46e7-9894-7c3c56cc41a5","resolution":{"observed_at":"2026-07-31T23:10:22.222243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-31T23:10:22.349221Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:22.349221Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:fbd11f2c90e2de060a98c6e11c9b65d20d23f5ef4b56713063162d5df64fb559","observation_id":"44e8d6b3-4469-44b0-8efb-94a007ba7662","resolution":{"observed_at":"2026-07-31T23:10:22.349221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-31T23:10:22.518445Z","title":"arXiv preprint arXiv:2502.13923 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:22.518445Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:6ac3953a807071c9572a9f5b43d74cf57580e3f6ccad78da241049195c0c53c5","observation_id":"1d437bfc-b390-4bdd-91d6-43a564af42e7","resolution":{"observed_at":"2026-07-31T23:10:22.518445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-07-31T23:10:22.677010Z","title":"arXiv preprint arXiv:2501.13106 (2025),https://arxiv.org/abs/2501.13106","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:22.677010Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:eba5ce0380c6859110883d36774796db95217d40a04d9b40580a73c179afceba","observation_id":"a5f4505b-d7ac-424a-8a39-004264709c4c","resolution":{"observed_at":"2026-07-31T23:10:22.677010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:22.817549Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (June 2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:22.817549Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:24981af3f0517c9b065768d1020ade315ac3c111ffd14d7ee62c770ee2aaa305","observation_id":"8a983010-8492-4af2-9091-07b233fdfd05","resolution":{"observed_at":"2026-07-31T23:10:22.817549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-07-31T23:10:22.906855Z","title":"org/abs/2511.16719","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:22.906855Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:626a7e2123c0798cf5fa028fbc4b669b6bbaa4f5cac648b244efdea205331d22","observation_id":"1c354eeb-2b08-471e-992d-854f167e7438","resolution":{"observed_at":"2026-07-31T23:10:22.906855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-07-31T23:10:23.050090Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:23.050090Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:29c03a055fc2187cedf9986482dd2fa5ced1efdab0a05e1f83adb9f642e70c3a","observation_id":"ee143839-8c31-4226-8e3b-9313cf30893d","resolution":{"observed_at":"2026-07-31T23:10:23.050090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-07-31T23:10:23.170747Z","title":"arXiv preprint arXiv:2412.05271 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:23.170747Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:43ba5988df3ad4da70770c013f941da7cde1a5b238bdca744505dad718a76ec9","observation_id":"2ef66a34-ac8e-4f0e-aaf1-ffa41d518b31","resolution":{"observed_at":"2026-07-31T23:10:23.170747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:23.289784Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:23.289784Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:e35aa677926fe794af1956d9e0e836ffae0a645276815694ed9999bf882439ff","observation_id":"1b689a8b-f06e-4bd9-9ad6-53aea585b22d","resolution":{"observed_at":"2026-07-31T23:10:23.289784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:23.421871Z","title":"Open Textbook (2024),https://oceancv.org/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:23.421871Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:adbab46f1688f1c14ae0678789946e902f78ec235ff0f921e49b2a38badaffdc","observation_id":"0383a5ac-7644-4645-a262-cc9c24868bb0","resolution":{"observed_at":"2026-07-31T23:10:23.421871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02748","last_updated":"2018-07-31T09:05:07Z","snapshot_observed_at":"2026-08-03T12:36:09.252863Z","submitted_at":"2018-04-08T20:07:13Z","title":"Scaling Egocentric Vision: The EPIC-KITCHENS Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02748","snapshot_observed_at":"2026-07-31T23:10:23.473064Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:23.473064Z"},"links":{"cited_paper":"/paper/1804.02748","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:34f2af2517163b2ce1972cb1625f895d1eb9866703fa8ca6f4434fdf32b56ec2","observation_id":"d79e7a28-927b-43b5-8eed-f403aed90b0f","resolution":{"observed_at":"2026-07-31T23:10:23.473064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:23.522254Z","title":"In: European Conference on Computer Vision (ECCV)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:23.522254Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:2b024eac2e15d89fc4a72eef9ce59c9473d8380e4ccc44e73d013c517a62e9fd","observation_id":"c5493225-8cff-4957-a748-01ed4902ce00","resolution":{"observed_at":"2026-07-31T23:10:23.522254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.03982","last_updated":"2019-10-29T06:26:37Z","snapshot_observed_at":"2026-08-07T04:39:24.613881Z","submitted_at":"2018-12-10T18:59:07Z","title":"SlowFast Networks for Video Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.03982","snapshot_observed_at":"2026-07-31T23:10:23.588699Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:23.588699Z"},"links":{"cited_paper":"/paper/1812.03982","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:096feda2e210fa14bb34ea15c0df92ca50449fb5c787d75077175757e6b788cb","observation_id":"1e5b41d4-6821-410e-a50c-8896d9521bc8","resolution":{"observed_at":"2026-07-31T23:10:23.588699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00318","last_updated":"2026-04-04T04:38:43Z","snapshot_observed_at":"2026-07-06T21:34:05.672636Z","submitted_at":"2025-05-31T00:08:21Z","title":"Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00318","snapshot_observed_at":"2026-07-31T23:10:23.676357Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:23.676357Z"},"links":{"cited_paper":"/paper/2506.00318","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:96c0410a3c8e4acca606ac9df6e97b0a3160df8e09d73baf0577466c37a76e9b","observation_id":"eac45911-5279-4a6d-85e0-f87a9ea29664","resolution":{"observed_at":"2026-07-31T23:10:23.676357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:23.747978Z","title":"ICLR / Nature Methods (2024),https://openreview.net/forum?id= d5HUnyByAI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:23.747978Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:ae701ef30118551fcedd468c48f01fe91c2168b2d552079300ff99a6981b1656","observation_id":"e762ddf7-d050-46e1-9e43-5a84ec8af3e9","resolution":{"observed_at":"2026-07-31T23:10:23.747978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:23.832844Z","title":"ACM Computing Surveys56(4) (2023).https://doi.org/10.1145/3578516, https://dl.acm.org/doi/full/10.1145/3578516","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:23.832844Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:c4b570e2e3f4e3cee8e6314cc3feabee8e794f6d5eb6303b33b8ca0ddbecc429","observation_id":"1e27cee1-d146-44ba-b6e2-98910db49b0c","resolution":{"observed_at":"2026-07-31T23:10:23.832844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:23.918770Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:23.918770Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:45f44a194c2ca6bfe31b134d26f0482bb4efa458f429605e3ae7951a21c9d871","observation_id":"9bad3bbd-bafd-48b3-b527-c07c8a5d6191","resolution":{"observed_at":"2026-07-31T23:10:23.918770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:24.004878Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.004878Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:caa1c103fe2765725cb34207086fee8a0199679488b2a344602786eb96d9131f","observation_id":"d128d299-86ad-4479-acbc-1b2ad9c7b5aa","resolution":{"observed_at":"2026-07-31T23:10:24.004878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14794","last_updated":"2024-11-22T08:33:36Z","snapshot_observed_at":"2026-08-03T12:43:16.262641Z","submitted_at":"2024-11-22T08:33:36Z","title":"VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14794","snapshot_observed_at":"2026-07-31T23:10:24.087228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.087228Z"},"links":{"cited_paper":"/paper/2411.14794","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:7c6888b65553159799e200771b547eb7b9ca1a67d07c306db7e77ec52d1a12cb","observation_id":"258700ec-3943-4844-af85-1f3c86fba121","resolution":{"observed_at":"2026-07-31T23:10:24.087228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:24.166288Z","title":"IEEE Transactions on Image Processing (TIP) (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.166288Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:e06b327f64d0cffef96e4a93ba127a97f961eb6922e57c87de3df1639d26d3bb","observation_id":"78403d19-913a-4846-88f9-0d506ce8a2f5","resolution":{"observed_at":"2026-07-31T23:10:24.166288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-07-31T23:10:24.249645Z","title":"org/abs/2106.09685","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.249645Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:370af40245bccf45eb2f56fafab8d5966f4c8d6410493ff4a6b211c506e71abb","observation_id":"8ffa66ae-8b59-44f6-952c-b1f704382ce5","resolution":{"observed_at":"2026-07-31T23:10:24.249645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:24.329544Z","title":"Ecology99(2) (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.329544Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:6d50e64ec020952ded576d086912226e8e997ec39349757b0a116c2504f87388","observation_id":"43612224-3a19-4b30-a6c3-5c6be1694cd9","resolution":{"observed_at":"2026-07-31T23:10:24.329544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:24.411559Z","title":"IEEE Transactions on Image Processing (2023),https://ieeexplore.ieee.org/document/XXXXXXX","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.411559Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:a6bc8e29f78de66b46fb9012ba259dc3668e071b002f29e8291e877376c46568","observation_id":"db9e755c-d34f-45dd-868c-47e657368bf2","resolution":{"observed_at":"2026-07-31T23:10:24.411559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:24.493160Z","title":"In: IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.493160Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:9d0a1dd4a8e4bac66b756c5c526f3c803497c8bcebb7cd206147e091e5ca1441","observation_id":"6a97a6a0-02ce-4564-b3c7-a2a9fa2e5416","resolution":{"observed_at":"2026-07-31T23:10:24.493160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:24.583283Z","title":"In: ECCV Workshops / arXiv preprint (2025), https://www.researchgate.net/publication/389540473","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.583283Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:e6117adfe2c1ab4ca43df7f1ac6da0f336e150f6f8375f07646e639e47a2dbaf","observation_id":"92e1ee6f-4dc1-403d-a367-a6f10ff326ba","resolution":{"observed_at":"2026-07-31T23:10:24.583283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:24.659819Z","title":"In: Pro- ceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.659819Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:8bf52b9694f3f3fc063d4acdc9cc70b9876c837d5c531a1a32f457f80e6942de","observation_id":"5816802b-b8f6-4471-8839-44465afd2877","resolution":{"observed_at":"2026-07-31T23:10:24.659819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:24.736311Z","title":"arXiv preprint arXiv:2509.18802 (2025) 18 A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.736311Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:9a43abf9c8b1bd730df72520c25a74e7e1b2e8eef151cb4fb2a1a9ecf967c4b8","observation_id":"e6a5c83b-36b4-49a9-99b9-19e022d552cc","resolution":{"observed_at":"2026-07-31T23:10:24.736311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:24.827377Z","title":"arXiv preprint arXiv:2511.07923 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.827377Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:49c58d784fce61b9aa598c38336c636faf024ce10d881d6751a0e3c5d832e869","observation_id":"ccd749e4-659f-433c-8cb1-5dac05edeb4c","resolution":{"observed_at":"2026-07-31T23:10:24.827377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:24.898738Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.898738Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:0f781a77db02943f77b75628cbbbb5532469533edcb8e6b0ba79a4ec8bb24ba5","observation_id":"82fb27e0-e7bb-460d-821b-00ea36e94c3c","resolution":{"observed_at":"2026-07-31T23:10:24.898738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:24.982174Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:24.982174Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:3c780c57d2fe0a2f1cfa9a8bba8e5a468efa742346ceb148b65e217409947316","observation_id":"22ded55c-5644-4a80-8772-f601838a33d0","resolution":{"observed_at":"2026-07-31T23:10:24.982174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:25.063815Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.063815Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:b3f85981713762e15be414cea4d357dde7c202e3148c62ae46d6b1bc8e913293","observation_id":"ee0c7d18-7743-43b9-8adf-2e4825dd78a1","resolution":{"observed_at":"2026-07-31T23:10:25.063815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:25.148562Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.148562Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:ad66b7bb566b2f4be3fb2a59cc394141746b1e93067b2d61fef7aca4be73695e","observation_id":"ad28ce40-35a5-4c77-a94f-73bec62499d9","resolution":{"observed_at":"2026-07-31T23:10:25.148562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:25.244196Z","title":"In: IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.244196Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:577c1be8b8736a06720eaf3dead272d6ecfec504d8d53fda7bcb600d3716dd05","observation_id":"e869d45e-8c25-4310-b725-c347774396ff","resolution":{"observed_at":"2026-07-31T23:10:25.244196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-07-31T23:10:25.316927Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.316927Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:d3be77a85258d0664e36d29662400690849c2ffc1de6e651e8b2946867ef5576","observation_id":"0c4e14c2-93e0-4fa0-8dd9-0b819f140dfa","resolution":{"observed_at":"2026-07-31T23:10:25.316927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:25.404934Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.404934Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:269c44e4c271c30907e95a3f1e0de88d139ce598aaffc3e8d2f030062ff18f93","observation_id":"08962aaa-5bb7-4fba-bd0d-d672bb9a9e45","resolution":{"observed_at":"2026-07-31T23:10:25.404934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:25.502397Z","title":"In: Proceed- ings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.502397Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:5c7cad3602be60fb1aac9325291d346e883e2c0eb61fc8d6131108179000ae70","observation_id":"7fa040e0-4df0-49a5-b88b-b7fb7285ae12","resolution":{"observed_at":"2026-07-31T23:10:25.502397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-31T23:10:25.558833Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.558833Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:9f3ed67af490f1769fdc50c70325a9bbc363d4f4d517792ea2b80d6b5c507ba2","observation_id":"498f92b7-baeb-485a-a4f2-b7ff4aadce44","resolution":{"observed_at":"2026-07-31T23:10:25.558833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:25.572047Z","title":"Frontiers in Environmental Science (2026),https:// www.frontiersin.org/journals/environmental- science/articles/10.3389/ fenvs.2025.1689855/full","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.572047Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:bda67bb84eaf5062c2ab7fb988667ed133feab3d20ec7dbacba4f08dbb370d47","observation_id":"ca6a0799-3008-4322-a6ac-ab0e6c56f2f8","resolution":{"observed_at":"2026-07-31T23:10:25.572047Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20651","last_updated":"2025-02-28T02:12:24Z","snapshot_observed_at":"2026-08-07T20:57:58.513635Z","submitted_at":"2025-02-28T02:12:24Z","title":"The Common Objects Underwater (COU) Dataset for Robust Underwater Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20651","snapshot_observed_at":"2026-07-31T23:10:25.594586Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.594586Z"},"links":{"cited_paper":"/paper/2502.20651","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:2afb10f346f2bcdcf7647d1f525cfc2f0f66b724098e8e0fbd94b96782333f11","observation_id":"70f435c2-c845-4fac-8eb5-3387e53b3fe1","resolution":{"observed_at":"2026-07-31T23:10:25.594586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:25.646682Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.646682Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:19edb8d6250ace88ec3ef708455565f01008bf890141ae14a71da2f44ed79555","observation_id":"cdc6673a-abe6-47c6-a47f-061c6a1e04a9","resolution":{"observed_at":"2026-07-31T23:10:25.646682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:25.739002Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.739002Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:28fa176ee4b4bd8077d88291f8c4d616b217c76707a04ed87ea6c37d30cabc19","observation_id":"81f16017-a9c6-4406-bd59-1e6eb6886ba7","resolution":{"observed_at":"2026-07-31T23:10:25.739002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-07-31T23:10:25.870578Z","title":"In: Thirty-seventh Conference on Neural Information Processing Systems (2023), https://arxiv.org/abs/2305.18290","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.870578Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:bd7e1ca6e522fd68fc8af69b058672c7031f566b4f53e65370f822287347b831","observation_id":"084e1dd9-2cb9-4f0d-bb64-b30284e31c62","resolution":{"observed_at":"2026-07-31T23:10:25.870578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:25.961997Z","title":"In: IEEE International Conference on Computer Vision","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:25.961997Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:3b1bfc9d4ff0d590f1899d1fc22f00b70260776d4653ff7d3477f95c909e561d","observation_id":"e94078f6-0800-4c09-90af-3e8ac6381f50","resolution":{"observed_at":"2026-07-31T23:10:25.961997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:26.088223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:26.088223Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:c73d6ebcfe49f621abe04d7e60e3c33ade2fdc78b7c502dced4af60287cd64fa","observation_id":"cbaddaee-cbe9-42ac-90d7-6838f892764a","resolution":{"observed_at":"2026-07-31T23:10:26.088223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:26.231673Z","title":"IEEE Journal of Oceanic Engineering47(4), 959–974 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:26.231673Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:8a4d92d35560d6007661b618295e6607cd579d3e46ececa439482ab8c070be98","observation_id":"6c777e32-a998-4465-b1b8-a8242f42a231","resolution":{"observed_at":"2026-07-31T23:10:26.231673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2199","last_updated":"2014-11-12T20:48:33Z","snapshot_observed_at":"2026-08-02T14:08:16.661387Z","submitted_at":"2014-06-09T14:44:14Z","title":"Two-Stream Convolutional Networks for Action Recognition in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2199","snapshot_observed_at":"2026-07-31T23:10:26.382044Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:26.382044Z"},"links":{"cited_paper":"/paper/1406.2199","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:b21472b2e93041f4351fc33b298b07ed286f15de2eac64cc9c54de7f11eb695a","observation_id":"ac1e33c2-062c-41d9-8b64-94691bf78d8f","resolution":{"observed_at":"2026-07-31T23:10:26.382044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:26.588243Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:26.588243Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:d27980d49119dac1b193a47459b287bfec72f981eb8122cc00aa351fd14f2cca","observation_id":"0426039a-84ce-438d-b09b-3f91a9fb4afa","resolution":{"observed_at":"2026-07-31T23:10:26.588243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.03363","last_updated":"2019-06-08T00:45:18Z","snapshot_observed_at":"2026-07-06T07:58:54.164423Z","submitted_at":"2019-06-08T00:45:18Z","title":"TransNet: A deep network for fast detection of common shot transitions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.03363","snapshot_observed_at":"2026-07-31T23:10:26.744199Z","title":"arXiv preprint arXiv:1906.03363 (2019)","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:26.744199Z"},"links":{"cited_paper":"/paper/1906.03363","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:360585d08395f786398897554899d9ac9f962675aa5e3c421f6c255e97e2222c","observation_id":"3340bb07-07c6-4b39-ba1e-c7b07e77b280","resolution":{"observed_at":"2026-07-31T23:10:26.744199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21271","last_updated":"2025-02-28T17:46:29Z","snapshot_observed_at":"2026-08-07T17:39:04.434684Z","submitted_at":"2025-02-28T17:46:29Z","title":"Adaptive Keyframe Sampling for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21271","snapshot_observed_at":"2026-07-31T23:10:26.849086Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:26.849086Z"},"links":{"cited_paper":"/paper/2502.21271","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:6ed90dba902ecadace495c806b51fd5740af6d3f9453897cf289d83d87539e25","observation_id":"af7d562b-05a6-4f33-bbc3-475a9f2a52a7","resolution":{"observed_at":"2026-07-31T23:10:26.849086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:26.963341Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:26.963341Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:7575e47b03d4e8538914679b649b7719d17b973b6384e3a2be3d609f9d788576","observation_id":"ed408398-be2d-45b6-b5f9-355dd197eed4","resolution":{"observed_at":"2026-07-31T23:10:26.963341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-31T23:10:27.007681Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:27.007681Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:f99e139fa3f07a32424606232de820e305907e08402e76e0a4a46e3df7ef1acf","observation_id":"ededc05c-dcc1-42ac-beff-18ca8979d658","resolution":{"observed_at":"2026-07-31T23:10:27.007681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-31T23:10:27.056091Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:27.056091Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:82962aebf561dec1bac69bf7714a89d46ce4e8585fad1bdae309240017683872","observation_id":"c41c514c-b71e-49b7-9cae-18f06832058e","resolution":{"observed_at":"2026-07-31T23:10:27.056091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:27.187334Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:27.187334Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:32e9b971a0b2626ac033ed97a5fba49568a319ecf05c9b928822229b54a868ad","observation_id":"a6e97a69-bd32-4407-855a-14984b81b1e3","resolution":{"observed_at":"2026-07-31T23:10:27.187334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-07-31T23:10:27.287118Z","title":"arXiv preprint arXiv:2508.18265 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:27.287118Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:041f5d4294ec70a67c1683f26d0c303b4de262550bfc5389ca362a413687fd0b","observation_id":"e8ee6382-5ee1-4b5c-a0da-e9da370e1e30","resolution":{"observed_at":"2026-07-31T23:10:27.287118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:27.428589Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:27.428589Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:c48c5592d3d7f1321614e274b5fa35059e06da29112ba4743c036c48d413ade2","observation_id":"02c0197f-95fc-45fa-94fc-eeb943437b8c","resolution":{"observed_at":"2026-07-31T23:10:27.428589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-31T23:10:27.561730Z","title":"arXiv preprint arXiv:2307.06942 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:27.561730Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:daeecaa595526d272f9c1279dcfed149473c3c0cdb6876650fdacad0366b5ddd","observation_id":"b0f8e8f5-cf37-4d83-9e26-a66c6e860f4a","resolution":{"observed_at":"2026-07-31T23:10:27.561730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18605","last_updated":"2024-12-24T18:58:43Z","snapshot_observed_at":"2026-07-06T20:12:54.710203Z","submitted_at":"2024-12-24T18:58:43Z","title":"Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18605","snapshot_observed_at":"2026-07-31T23:10:27.748996Z","title":"arXiv:2412.18605 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:27.748996Z"},"links":{"cited_paper":"/paper/2412.18605","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:7799631a543d5a8248060da4bdeb62206c1d245cbe9903182d2b82b41d69f023","observation_id":"631196ef-4ba6-4647-923c-8f61a330be86","resolution":{"observed_at":"2026-07-31T23:10:27.748996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-07-31T23:10:27.917197Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:27.917197Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:48cf86de740791d770e7311047aa84a7293b9b040d87af9216460e9b4295bd21","observation_id":"0a51f3d4-3791-4c65-9400-644480786b9a","resolution":{"observed_at":"2026-07-31T23:10:27.917197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:28.024393Z","title":"arXiv preprint arXiv:2508.18729 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:28.024393Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:a3269d86e9c7cfe0a486f63cef636a69d39e447c4d1a133dbcca846757059bdc","observation_id":"84f77562-49c2-49f2-918f-723676719bd1","resolution":{"observed_at":"2026-07-31T23:10:28.024393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:28.101851Z","title":"Nature ecology & evolution4(11), 1451–1458 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:28.101851Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:5a70a28bd5430f765442062f1290ededcb994ad41574fc492e01931061264620","observation_id":"d56f6f16-d0f4-40e0-b76d-d25cc871ce3a","resolution":{"observed_at":"2026-07-31T23:10:28.101851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:28.190059Z","title":"arXiv preprint arXiv:2512.21150 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:28.190059Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:21a2e9eb2e06fe5045eb7aa313bc82e2e6026ed255aed0fca3c05d2c096e5d7f","observation_id":"6e52992d-dbee-4a95-ae5d-19a764312fb1","resolution":{"observed_at":"2026-07-31T23:10:28.190059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:28.332450Z","title":"arXiv preprint arXiv:2512.21126 (2025) 20 A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:28.332450Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:02162e29dc4ceb116be6f49815bd1d0efcd6572aa25ed8893e18a5627a27c7f0","observation_id":"9d29823e-c8d4-4651-a644-c15b72569444","resolution":{"observed_at":"2026-07-31T23:10:28.332450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:28.468879Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:28.468879Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:a9e57056d7269efc8ffd380476fb0f1277980a16828ac83fc0acceace21da1b5","observation_id":"bf6bbbab-8f80-46c2-95d3-3e7ae1a06c2c","resolution":{"observed_at":"2026-07-31T23:10:28.468879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:28.589322Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:28.589322Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:bc63c018a87c3053ae0215cd0781db1eec7c4dc1be1a51b503cd10bf1946e04f","observation_id":"2b4b6889-c709-4bb8-b6b2-9b1143feeef8","resolution":{"observed_at":"2026-07-31T23:10:28.589322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:28.654677Z","title":"In: IEEE/CVF conference on Computer Vision and Pattern Recognition (CVPR) (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:28.654677Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:944e750a38271e2839be3bcc3619d2ef979ec05ba5e82b35945c4a0e62b51786","observation_id":"05d99362-3756-4dcf-bbe1-c88fbef1f7ad","resolution":{"observed_at":"2026-07-31T23:10:28.654677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:28.738985Z","title":"In: Moens, M.F., Huang, X., Specia, L., Yih, S.W.t","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:28.738985Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:a528895bdcc4bc66b6e010ca99c61d193d356f2bdf463790b105b2dd25758111","observation_id":"9ba64ee5-23c5-452c-a57b-6a6928361c27","resolution":{"observed_at":"2026-07-31T23:10:28.738985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:28.847970Z","title":"arXiv preprint arXiv:2510.27481 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:28.847970Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:cee138dead8f4d0e56f4e6062e49e62a61cd202d79a34693d07f1d2199f9771f","observation_id":"d3d06aa8-c67d-4c5f-bda0-fc8a51433c5b","resolution":{"observed_at":"2026-07-31T23:10:28.847970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:28.947928Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:28.947928Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:107ae318bc2ebb2c2ee162bf64e05942e042778efb3b4f727dc080624d2702be","observation_id":"c44fb001-af47-4238-8f22-020329a6d727","resolution":{"observed_at":"2026-07-31T23:10:28.947928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:29.028855Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:29.028855Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:ca1c1c12d583d83a558d69ff2c4bc151946c410d1b4dda89543a48485daddc1e","observation_id":"0016588a-dc6a-498d-b238-a675fcbf5b97","resolution":{"observed_at":"2026-07-31T23:10:29.028855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-07-31T23:10:29.072981Z","title":"arXiv:2406.09414 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:29.072981Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:22dc6419501674bb51eaf14f42406c696e144ab47d3dd483ce96826c29547eb7","observation_id":"c3667ed5-1b20-4864-b4ee-bf95e0799d11","resolution":{"observed_at":"2026-07-31T23:10:29.072981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:29.174381Z","title":"arXiv preprint arXiv:2412.04467 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:29.174381Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:7cfd99805e9becc6996595798d1dd0b04f6cae0b83f4ed048988f0887084125a","observation_id":"3ccc2325-8d8e-4a0a-a86a-87a2663f1aaf","resolution":{"observed_at":"2026-07-31T23:10:29.174381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-31T23:10:29.280696Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:29.280696Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:77f7f3979c834fc9a8ca08a708c88f1bd5c118259adb7bb497cd5d40b071cb3d","observation_id":"0547b9a0-a4d4-4fe1-80dd-e5478e1664d9","resolution":{"observed_at":"2026-07-31T23:10:29.280696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:29.343815Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:29.343815Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:15093521e3482b4af741c4d4b7f1c973e36f7a9f23a6713279cb74feb44f27f3","observation_id":"c09fd72e-f7b2-4272-b121-6f94f1ecff00","resolution":{"observed_at":"2026-07-31T23:10:29.343815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02636","last_updated":"2021-10-21T23:24:26Z","snapshot_observed_at":"2026-08-05T21:46:08.465343Z","submitted_at":"2021-06-04T17:57:39Z","title":"MERLOT: Multimodal Neural Script Knowledge Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.02636","snapshot_observed_at":"2026-07-31T23:10:29.387419Z","title":"CoRRabs/2106.02636 (2021),https://arxiv.org/abs/2106.02636","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:29.387419Z"},"links":{"cited_paper":"/paper/2106.02636","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:6c4cc2190154d112acea5cefad4584762ee3974a810de3bd9bfc5359938835b7","observation_id":"04a0d3a1-a86d-4b99-9c69-2f479cc47c20","resolution":{"observed_at":"2026-07-31T23:10:29.387419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-07T11:19:24.597547Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02555","snapshot_observed_at":"2026-07-31T23:10:29.516601Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:29.516601Z"},"links":{"cited_paper":"/paper/2506.02555","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:a31a7337c2b12be2cde42ce48a94b96df403512e8ade3a762c00e71b8797c902","observation_id":"05a2e1cd-382f-428c-9eff-a8a348db8818","resolution":{"observed_at":"2026-07-31T23:10:29.516601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19818","last_updated":"2024-05-30T08:25:21Z","snapshot_observed_at":"2026-08-06T06:48:16.944406Z","submitted_at":"2024-05-30T08:25:21Z","title":"WebUOT-1M: Advancing Deep Underwater Object Tracking with A Million-Scale Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19818","snapshot_observed_at":"2026-07-31T23:10:29.609327Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:29.609327Z"},"links":{"cited_paper":"/paper/2405.19818","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:a77870d84733a8e98b5532e43476fc5e6db240903ebe28fed6b3669182560c16","observation_id":"36582010-0ff6-4d13-b997-98b56208ef0e","resolution":{"observed_at":"2026-07-31T23:10:29.609327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:29.670399Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:29.670399Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:ef5d725aa7f2020f97da1a7acd6b766f19515850f1a0c4f6c578f66cc6a341bc","observation_id":"4aca69ad-7f04-4d56-885a-98e582fb179c","resolution":{"observed_at":"2026-07-31T23:10:29.670399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:29.796833Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:29.796833Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:29cfb389f38223cfee7d518b6777765ee11d1e36093fc4aaeb0c41b811cfd811","observation_id":"95ad4b6d-519c-4d60-8c6b-d81e2f3c56be","resolution":{"observed_at":"2026-07-31T23:10:29.796833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:29.902831Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:29.902831Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:4e46540c44619e9134a4f82f292e2bf40c078fcf72c5b60c9ba83cfe57391b99","observation_id":"f5bcbf67-46c3-4da0-b1c6-091cf2c44b64","resolution":{"observed_at":"2026-07-31T23:10:29.902831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:30.016024Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:30.016024Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:7b9ed3170361f3a55d490074f1fced9affeb9097862b41e47a53b157919ae12d","observation_id":"d8669ed1-48d3-4506-93e6-a9318c80102d","resolution":{"observed_at":"2026-07-31T23:10:30.016024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-07-31T23:10:30.144824Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:30.144824Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:73cbd73ec4517eb01335b25f2bd925cbe02ff1390a1f3d845205d9eb42148175","observation_id":"366fa31c-9cda-4f6b-a72f-f96951f084fb","resolution":{"observed_at":"2026-07-31T23:10:30.144824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:30.225272Z","title":"ECCV (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:30.225272Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:d606fdab08099fafb91242c33c32c04c09d224f4e2e88dab31ae40e4ceed79a0","observation_id":"4057c4f4-fff8-4cf8-be42-cccd278ba4e4","resolution":{"observed_at":"2026-07-31T23:10:30.225272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:30.295605Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:30.295605Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:7275c25cc5e9bda47d7793ed6bc86ea6dfa43274b9a79918d7968ea8c57fb907","observation_id":"e0bd617f-69c0-46fe-bd10-fcfae97d1164","resolution":{"observed_at":"2026-07-31T23:10:30.295605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:10:30.365612Z","title":"In: IEEE/CVF Winter Conference on Applications of Com- puter Vision (WACV)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:30.365612Z"},"links":{"citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:43c973fff1fcc2fc7ad0a528fd258efb69feced429987ca8b57e6b3d36d4c6c1","observation_id":"39e391b1-236d-4344-b680-99efb79a653d","resolution":{"observed_at":"2026-07-31T23:10:30.365612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-31T23:10:30.674790Z","title":"arXiv preprint arXiv:2504.10479 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-31T23:10:30.674790Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.24064"},"observation_digest":"sha256:52195a8d13d31fa13432b26cc94513b6c6859f6fdb5286c779cd4c96743239bb","observation_id":"07a82329-17bf-4363-b3fc-0ed2dd978eef","resolution":{"observed_at":"2026-07-31T23:10:30.674790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24064","last_updated":"2026-07-27T07:06:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T19:31:49.457969Z","submitted_at":"2026-07-27T07:06:14Z","title":"MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":90,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 0 inbound Pith citation observations for arXiv:2607.24064."}