{"as_of":"2026-08-07T09:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16678841cceb50351f64a2935f2ef5a17fac32a7b63a950609aa377637b64899","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T14:53:56.693464Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09876/citation-record","integrity":"/paper/2607.09876/integrity","json":"/paper/2607.09876/citation-record.json","paper":"/paper/2607.09876"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:0d12bc165b422bfbaa1e045c21780e006115c7e5db1c9c7e34aab68f6ffe7ccf","observation_id":"f01dd69e-df51-4feb-a138-323320e73d64","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Neuron84(1), 18–31 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:f35588fd100aff2736fb772de8f365ec8ba99b371c79e67923bdc852ccc2261e","observation_id":"111ea044-6f56-41a5-96b7-9313c18a624e","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE international conference on computer vision","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:ca1dfc6665b22c231d196e85368a83b0c3d70da46cc1f1191f702158482c2aef","observation_id":"8e26c0cd-a58c-40a6-9b97-3a9c07490673","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-07T02:30:11.447693Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2404.08471 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3597fc3b43ecb2c5a5476a906f100ef5d4538e44fd815578a9ae151ef9c4f784","observation_id":"176db882-ad33-47b9-b690-526987fd8afc","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06772","last_updated":"2019-07-15T22:15:00Z","snapshot_observed_at":"2026-08-06T15:08:12.387610Z","submitted_at":"2019-07-15T22:15:00Z","title":"Efficient Pipeline for Camera Trap Image Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06772","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:1907.06772 (2019)","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/1907.06772","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:47fa19851511330ef1f85266dd83ce8aab4c5fb0f5ba41fda2009ea168f7a643","observation_id":"030d5e95-857a-4d89-ab8d-10e18bbaefd9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings ofthe European conference on computer vision (ECCV)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:27c1d7b76d30fe6af911ddfb62e2d5db073cc077cab533d91e7259f803d494d1","observation_id":"796e2264-56ac-4216-98fd-84e6a6fb13e5","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Behavioral Ecology22(2), 236–239 (2011)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:138870b2cb6cc6264a2537b6285a2906c334ed49ccca3f66a0af577d3f4bf53f","observation_id":"6bb4bda3-c4db-4bb0-a39e-8c11ff04da83","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Current Opinion in Neurobiology98, 103201 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:cd91b4e78899b4d64b87ffd03e202faf36402e7a917ff58f295530c7096bd3d8","observation_id":"285047d8-fd20-46a0-a582-4722a7dda5b9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08937","last_updated":"2024-04-13T09:17:51Z","snapshot_observed_at":"2026-07-30T13:59:06.216516Z","submitted_at":"2024-04-13T09:17:51Z","title":"ChimpVLM: Ethogram-Enhanced Chimpanzee Behaviour Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08937","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2404.08937 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2404.08937","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:41120d18644aa181d7776534f86dc1b2d1528aad9a7dd54f21299d0bfd9fbe48","observation_id":"57915c93-565e-4e89-a68b-2275aa453983","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"International Journal of Computer Vision pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:4aef9d0ec0afe21e48244879cb8bbdf37501d5392f4c1cc33661564b9af6118a","observation_id":"57560e06-badf-48b4-818e-518b6dd0bdc5","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Journal of applied ecology52(3), 675–685 (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:38791e7a5eeec9d84d09b86a93576ab9992e451e51de74caa6d1ada547b4ddea","observation_id":"6766aaa3-ee6d-4dd6-b62c-514cfcdec31c","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Ethology Ecology & Evolution14(3), 199–216 (2002)","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:eed10044faf617cc14589dcb30a7f13181eb08f4d4cefdce81a6786571e9171d","observation_id":"c299f90f-a6b7-46e2-b3f5-cdcabc49bac9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Remote Sensing in Ecology and Conservation3(3), 109–122 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:7f75366907af1b46f1ec6b10847455bedc4c7fe5980af13501bb0dc376dab237","observation_id":"750583b7-16e1-496f-b635-f674707965ec","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2511.16719 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:8dca23f7bcbcfed73130a7809bbf21572374d80dc699723802143a1542e47896","observation_id":"fd08f24f-6410-4364-a7a6-54e3426206ba","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3944b061798413e2b739b0379e9ba13aa35f5b956683e2b8c16d2bae941684ca","observation_id":"3fd01b74-83f5-451e-982d-59926e834d79","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: proceed- ings of the IEEE Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:0be168c4a2132c832a8c9640675e6cb338e29b59986afd1f1708f1928e61abed","observation_id":"4574b4da-d325-4eb4-958a-b9eb801f7e60","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:6a26a888f076d4210d599b1b187d849d612ee67069ff6302d23513c4e9cdae15","observation_id":"0417d80d-476d-4130-adfb-0d4223a47b2e","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:877243486da5b0750a97d769b6f82d2d366d0292db56b49e8056755cbd4f8a8d","observation_id":"2e98052f-ed9c-4b15-bf78-896b50e81032","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11959","last_updated":"2025-02-12T13:25:10Z","snapshot_observed_at":"2026-08-06T22:46:14.609928Z","submitted_at":"2024-12-16T16:41:51Z","title":"Gramian Multimodal Representation Learning and Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11959","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2412.11959 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2412.11959","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:605b740ebdc81b2272fdd293b2f3cb0f2e83b5901eccdb693e33a83ddfbc9730","observation_id":"7da1bbb5-bbca-431a-8b0b-4a87417d58e6","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Trends in cognitive sciences13(1), 36–43 (2009) 12 V","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:bb8bb496ce04af5810e221686d8cf191a75e0fb2bc29f8ee62aa959b95d4ab75","observation_id":"5d0af8e1-379b-4516-9c97-12304769042c","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Trends in Ecology & Evolution38(4), 346–354 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:5a21ea3e1277f8e20546cbba42b99ddadbe2e4bda8944e6971ec598427ce5bf1","observation_id":"171c21f3-1875-4cb7-a59f-d544ea03d32c","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:ed3c6fd76aec0be6fa869b8900ce53e2edc688cfb9b0cc271f11114f56fcf2d5","observation_id":"2b2c80b1-c02a-4028-a4ab-8ddf46fda476","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:ce298d4eee950c9af718e96709b89bc9e7d1c84e1e31b5b814693e3109320c38","observation_id":"92d0b707-195c-4c0c-9f95-1fe0c2842892","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"IEEE transactions on circuits and systems for video technology32(8), 5680–5694 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:fb7273f7327e4037a26e9846d709a7022500d3196954bf607e7075c1cc497d99","observation_id":"45bfd703-1818-4b99-a10f-0a170a8cae35","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17698","last_updated":"2024-06-03T23:24:39Z","snapshot_observed_at":"2026-07-06T18:20:57.086853Z","submitted_at":"2024-05-27T23:09:37Z","title":"BaboonLand Dataset: Tracking Primates in the Wild and Automating Behaviour Recognition from Drone Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17698","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2405.17698 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2405.17698","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:183010a1b0a2fb68691df2fc2321bc8cca33fb0a3ae0ead3201bc8fa4867b548","observation_id":"54f24dcf-f9da-438a-a835-e5b723a6f771","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"bioRxiv pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:35b190a8d71c85c626f32f14e9498883a3d93256206ed539954366b2aff59554","observation_id":"469d3a07-20cf-46c2-b92a-2311d8d9cf1d","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23952","last_updated":"2025-05-29T19:02:48Z","snapshot_observed_at":"2026-07-06T21:33:17.306281Z","submitted_at":"2025-05-29T19:02:48Z","title":"Leveraging Auxiliary Information in Text-to-Video Retrieval: A Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23952","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2505.23952 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2505.23952","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:7f34262e2350ce690a99bd8516972a0ee13ac7633155f5948ccc05816a3e9b31","observation_id":"1b832b2c-9da7-4d57-867e-52ebe882d8a1","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:4f5af1ef9df85375f8ee9f4602b1a21170dc30fc5c898c850cdd2739fa5332b2","observation_id":"8cabdd40-1e46-4cbd-9a80-dab14052fa5b","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"International Journal of Computer Vision pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:220d2f4ea9d91502dd6c2cc698afb76e94435b6efa347bea9bf58f018f0be1fd","observation_id":"50cc1e68-7b2c-4665-826a-badd91afa63c","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:386650baaf3b97bf299f0fc9bbcb76b4eb1d2472f9135502bdc5b7040da49139","observation_id":"18791d2b-b7bf-475b-8f56-b3d82c5da713","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"something something","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:23a0c4f355608a492691490b6aba83c48551de1ffb688008557d60e817136d3f","observation_id":"42f079aa-a626-4875-bb40-58049c6b0adc","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:b71b2e9ca6c688c7fee1d032f216604a892f513851d8fa8d9f7a4ca05a513d37","observation_id":"8d18e021-fcfd-4b60-926a-2065464d4fa4","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2509.14233 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3c1a0cb53feb59d04219764e08b095aaa592e783c817ad9ca44da3057103133c","observation_id":"371626c8-d373-45b4-9b3a-9d7c2b53b0ce","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Remote Sensing in Ecology and Conservation6(2), 129–140 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:bef14887471c716e08707c0839842795d53aefe06ae1545318e1eff7c62e56fe","observation_id":"d0dc9271-2414-4f07-bf8f-ebf4699112fe","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:cf8fab2783a1b6ced8c5bb927eb954a395065244b4a5e87ca8d72e93b94eac50","observation_id":"48f2d4ba-9973-4e41-8f93-095660433e54","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2310.068253(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:c12f9fc7873181e6d283c580be1e8605d16025773e6fe9d0ba199780ee46c425","observation_id":"7d826271-994f-4934-96de-3ccd8e6c38e4","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"IEEE Access (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:f88fbfbf4f16c4dd7ffcd893ed723ac1bc17fcc6d0f7fcb3ba058925f9ec297b","observation_id":"2270ee03-fff4-4bc3-a6cc-0facff2a1ddd","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:1705.06950 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:4df6c1b2d0c14b2afcd6c61be437f5b99726b9f6b83c6f04e566e044e8782cc1","observation_id":"9e8ddf18-e500-49ab-a610-7743cdf029f8","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Science348(6240), aaa2478 (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:0292e4e6d7bcaf2163ec9c4136530aade89fb812609a6f1c0f977d0d03616f27","observation_id":"4f018f8e-cb34-4c12-8520-0d367d5af935","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:a5fa87d9d6c194221466db1091e0f4cab7231a8a763ae993ddcc94720638d4ea","observation_id":"c7fbbce5-6fec-4ea8-9dc7-888d4cb37ded","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:1412.6980 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:68ff2cef81226819e29aeaa9f48ed3bd436be22415d53df58b2903b553904660","observation_id":"ce1b1783-cb58-486d-b571-85539a2d1415","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Journal of Animal Ecology92(7), 1357–1371 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:4556f8ed0aca3e2dccd8070e6cd7c2cef7375dd12be659e9a6df9a6b07eb648a","observation_id":"16e9c728-25ef-4e07-acd7-69175917dea9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceed- ings of the IEEE international conference on computer vision","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:2e670f19ad7adc29da63da9793ab28764621fa940787aa14763cd22c94a0b723","observation_id":"843bfee9-1262-42c9-bb7a-148771a11ea5","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:767fa9d0d7f173ce0ec01267aee121e897a21f6552d96c3aaf47f0d6452a69f8","observation_id":"c4009925-3aad-451d-99d2-174b93b6cad5","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Naval research logistics quarterly2(1-2), 83–97 (1955)","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:ed58e34a69392e746dac213ebd5f2e075ee3eb130464975472295e886ea3876e","observation_id":"926ab4e9-d461-426d-a2a1-ca40a2186671","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:6adec817eb06a0531601c6fb57163a400c87e7ef1d4bc43829296fda69dbbca0","observation_id":"498ebb8d-3f3a-47a1-9acc-6013175da885","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the 2024 conference on empirical methods in natural language processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:3f65422509179127d1fabe8596876e00fdf6380d8b3b8ccae7f342083e7581e8","observation_id":"5e6ddf0d-9526-459f-8bbd-84d8a3ec6bd4","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:8a989c8e69dfabfe2522a0896a76cd20613cad0f306831a89b89cc4f207e2b4a","observation_id":"13ee771f-c57a-4231-9cfa-f7a5f0ad6eb7","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Ecological Informatics83, 102797 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:38e9925cd5024289548bb77b34484c8921a5ca882c68a63ab7d996307eea2409","observation_id":"9119f306-c920-4806-bfb3-2e6a34947ec7","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08860","last_updated":"2021-05-08T08:25:57Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T13:59:50Z","title":"CLIP4Clip: An Empirical Study of CLIP for End to End Video Clip Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08860","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2104.08860 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2104.08860","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:b4d01f5cb01ab1a01fbcc8923918f33c8db5115a8d8261e6e3bbda210aaaf1a4","observation_id":"559a8468-8043-4bd0-ad4b-54f04ec750ab","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03173","last_updated":"2025-05-06T04:38:09Z","snapshot_observed_at":"2026-08-05T11:41:28.644662Z","submitted_at":"2025-05-06T04:38:09Z","title":"RAVU: Retrieval Augmented Video Understanding with Compositional Reasoning over Graph","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03173","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2505.03173 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2505.03173","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:f5c838cbeb2b23d789c0e5d632638b9460a46aa4b7b86be5643ce37091494271","observation_id":"ef80f3f6-6590-4486-9016-d493673eabde","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: LLM for Scientific Discovery: Reasoning, Assistance, and Collaboration (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:ce42b84c72bb934e08c96e16ad4fda17f4723d8e26410ca305e1ef75b065e120","observation_id":"7592f602-000a-4b79-91b9-7b05ca2561e7","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:7112be94a5054ed5e9599dcb3322fc865e96e58b86c8c358fc3c3df5a6c1bf39","observation_id":"0b2a0946-baec-49c2-a73c-49cbbaac872f","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:70714bf6e6382ad920bda9942c7db66556c3feaf0e240b738ece6dbe731abeeb","observation_id":"1680e6f4-1efd-462a-918f-6680b236d66b","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:fb63202301b616aaf4a71871e888ed1a6886e56618cd4da324e5617c9596ff42","observation_id":"663e4d5e-1650-46c7-ac1d-0a9ed66dcedd","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Proceedings of the National Academy of Sciences115(25), E5716–E5725 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:b7d56ba499e23e15f84bf81ae09e44f54c91234f5a3027a51dd2b4d18cbcc998","observation_id":"ba307d14-c27d-4748-915f-bc1dbeb2da35","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:47488dc73b58539e531122634e1c3d7c9d3f7fb6a89d3a5d7cd9c13a7f423577","observation_id":"483c3fbb-9710-4d5e-befd-d5885bebf45d","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Biology Bulletin Reviews1(4), 345–357 (2011)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:9c47e211b64ddb12e2ee50021fad81d84982f69935a6485eae1598e91ff5b894","observation_id":"17a0b0ab-9fbf-4f47-8462-18a4f1aa4401","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:9654cb53742623524bc141100eb09aaeebc2a6c3fd04e857c9ef0237b605c1e0","observation_id":"f1252366-890c-42cc-af0c-a474582e4f30","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:241a5357d55d780751ad61f47d09f44355977c1506583df458ea86696e50853c","observation_id":"9d9f373d-3459-4c63-bd6c-5aae5b4e344b","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"bioRxiv pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:7da23f8d9725b3ddae9c4fb18c1dc45252c69fad34e377d7fdf72939c6b59609","observation_id":"660ba61c-ceb7-4c21-b6bd-e68e9f0f651c","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Scientific Data12(1), 1200 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:429c0dcd7d6ce2b8c50b77d706d7713d72c9a1a9816bdca641e87c22cf8451ce","observation_id":"57ef61ad-50c3-47e0-b1a1-73f455a5eac9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11326","last_updated":"2023-06-20T06:50:50Z","snapshot_observed_at":"2026-07-06T15:44:27.766505Z","submitted_at":"2023-06-20T06:50:50Z","title":"Meerkat Behaviour Recognition Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11326","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2306.11326 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2306.11326","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:4fd1b8e6a24ac43ba6171acf5fa81da6c8f6282aea493ef9847db586750e6256","observation_id":"072fa5f6-28f3-418e-93e8-492d7f260091","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: International Conference on Multimedia Modeling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:ed855fbb6e2ef3c7236167632cb36b0b6b8b4dc663935e1c373c88f035c83fe7","observation_id":"e22d0a6c-707f-4bc2-9825-dd499b35a302","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:b8e3736034167f2cdb8041492fb45da5c3a10ee4014070f55371b5c99722cb13","observation_id":"c8de2da7-f8a0-43a4-9226-e2650cf44335","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Conservation technology79(2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:9543d04894e6840ef91a373c90be12feacf08608d80db99a182c82bbcb233f88","observation_id":"c2f38a0e-b4fe-4636-86e4-3cd0bfda05da","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Methods in ecology and evolution5(11), 1170–1179 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:1838148216b763fb18bdd6945c07e4fb3a57c891cba398937ef815923bc44de7","observation_id":"f898d01b-317c-4c8f-aa4b-d76eda00b60b","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:02d97377c2d96350fb2e74b35540996f7eaaf94334aecb4f91e4e148bed103eb","observation_id":"0b404fb1-47c3-4ce8-b496-5f43f1534b71","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Frontiers in Ecology and the Environment15(1), 26–34 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:1f91390b248c10aed6d9ef2588bec439243d28ac0d920eeb5e69ced767eaadc5","observation_id":"ccbc4c62-38b5-4875-a2c1-952ee8278ae7","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:351a65fe07922056d18f7061f33c7b650b6f28edd6c56ed6b9076be98d68f329","observation_id":"d471b07a-5ce7-4e18-9c43-2adc7f8cc91a","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Philosophical Transactions of the Royal Society B374(1781), 20190012 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:04a720710554424c5881b26d841b88f7a37091a72319cb89c336b04d5cb27d2f","observation_id":"2618d0d6-df96-4021-8f99-f5cba9b3e68c","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Advances in neural information processing systems35, 10078–10093 (2022) 14 V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:9e194eebbf190557fc8de49930e7b1f6518b4de1426e50ce74e638f23d17d94a","observation_id":"8a74ec1e-a7a1-413b-8841-f3d8d33fed51","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Nature communications13(1), 792 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:089d8553be27f37a9901ce307632577dc64ab55ba9b4e01ec8f30becf9ba1341","observation_id":"e0c223f7-941a-4edc-8ce0-024e216093a1","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:c7f8c8d1e954191e9d03d9ea5ddeb2938a30d403b22756418b1417e1c807809a","observation_id":"d35e55dc-7394-4d1a-bd08-6d1f136fb3c3","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2511.15656 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:2faa627f80a9c756f28f5dc038a486c3c24afcab4f2534303a5533cfa31bca93","observation_id":"2e58e6af-7076-4b61-907d-06ae07ff38cf","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Advances in Neural Information Processing Systems37, 126500–126514 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:eaa989151217bb256bbec31427195cba404070ca281f7a981a219213cff4b7f5","observation_id":"00cb7eaa-dbd0-4cb1-ae03-a7761b73635f","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Nature Methods pp","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:f8beb3bdbc399d8e3fcabe8d3dc5435955317b4b4c263c5317b52fa9fb9c0c98","observation_id":"710278fc-89c7-4255-b911-4e87a5418a32","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:a750664b37fc67edaa636d7150aab80da8a05b9f65225986570a78c6dc119acb","observation_id":"d7c73635-d317-4527-a8a4-9c64740c0923","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:bd5e5a60a720aec4b569e993426c0c8d102605b4a766f5cfacc21cb588837554","observation_id":"570800d4-ac1c-475e-93da-b8db0892aad9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2212.03191 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:285218f2121c54a4834d52f6d37bed4853362901ad224df258fddf67f5122887","observation_id":"6c80b62f-cce4-4116-aa83-1fa1c792e7a0","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Moens, M.F., Huang, X., Specia, L., Yih, S.W.t","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:5073470ea2b1462375a9aee32d33daa118a3e4e23f00f62067c7cdb4c06d9399","observation_id":"9a7bec54-73ea-4484-9547-d4efed6a338f","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:45e45ff5df601952f2241ecb16bf76251476ce9cac96ff82e3789c1066aa03be","observation_id":"c2c1dc07-e795-4ad7-adf7-7a56ed523be6","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: The Eleventh International Conference on Learning Representations (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:053e7ed89dcf9cd71831f158f73c4492aded535198e65dbd6c74a4bbaf68e4c5","observation_id":"3e7a1298-fbd6-4818-859d-757b881b54d9","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2505.09388 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:90ca89b74fc3c6b3d11ebcae8d6e470e9c5154975eb0f877799ed3795f876fbf","observation_id":"1e4e6658-506d-4ad6-8609-a11893d81313","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Advances in Neural Information Processing Systems36, 49428–49444 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:b778c26032b4952a68a121658f425b6fcc541e0041bcae8101874194c0380e21","observation_id":"a40bf709-6764-4b81-afb7-874127225e51","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:9721eb10229ca93bc39db9a96d712a8606adc3f66c3e1050a64cdca7cc00e269","observation_id":"7c142cef-6858-4642-8ee4-f778e7e5262f","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"IEEE Transactions on Circuits and Systems for Video Technology35(5), 4592–4607 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:eba4593ca2a711b65a35817a0fe07c7e973405e65a3361986a22aa8e1c98d689","observation_id":"0f1aa5a6-69bb-40c5-9a72-b6bf0c3a9054","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"Ecology and Evolution8(19), 9947–9957 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:14644f1e3e468718ab065c5f11e67f6c3289c2a873a5f467593de3f3081593a6","observation_id":"c71c078d-1a0b-4f9d-8bd4-07ea7e058cf8","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: 2025 3rd International Conference on Cyber Resilience (ICCR)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:63cb0f145c56778b360b60aa562b829a95a807d1803216aefd662bbebdce968d","observation_id":"c70996ca-d4b5-4561-8928-324b4a1cdf3a","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:54bbbeef2ca1d3fe38de344d2626fda9787e470032a3013d6b1dd968327c670f","observation_id":"d95a816b-4148-4874-85df-ed9db6a181b6","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:9a0c0bec9e84181346a9bc0402638ce7a3533c237931f8b9c9d02e16277a1598","observation_id":"f757b749-cbd6-4ead-995f-940d624dd71f","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:13c78b88a1ad11a35e0d4f14430c58618d891b6cbb6b5f51c65e1b9160622fc8","observation_id":"fa6a1a92-6e44-4f8d-b2e0-9d0e9dbcb4f0","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:309774ecf350b30ded30438fbe846fdadcd8dfe1f22b61b245d9acf26434a4ac","observation_id":"f66342fb-272b-4430-b025-e2c9b58f5b7f","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13217","last_updated":"2025-06-07T01:16:44Z","snapshot_observed_at":"2026-07-06T17:33:00.716054Z","submitted_at":"2024-02-20T18:29:49Z","title":"VideoPrism: A Foundational Visual Encoder for Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13217","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2402.13217","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:ac15460b8dbe904d6c7e205a704f4e006398ea1cb0cd95444f663cc3051d8b9f","observation_id":"6c3ce1ed-3842-4eac-9072-dbe8019e1675","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"In: Proceedings of the AAAI conference on artificial intelligence","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:bbfea92b647bf1922bcfcf739ffebfbd2253f08ef8a9814a6f8a8087e0d2f160","observation_id":"6ea1e093-a447-4dcc-bdca-700ef83feb93","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"characters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:ab997d69aca222ebbca1173b9f755ef0f52fb9fbab6f84a2b8deb7ef7f5c38b0","observation_id":"5ad58b8e-9c90-4c6b-93df-d2b10ff566da","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:01:00.152714Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":95,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2607.09876."}