{"as_of":"2026-08-08T07:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1da495de065e32fbdc11aba9a02f5a34f635c16481efbaea9ae43e4717b209a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:45:09.738221Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-24T04:48:54.299822Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T09:50:00.546571Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2204.00598"},"observation_digest":"sha256:23032dfbc1a68e0a491459d0ec0bc139747338820b91900cd8d7b20dbbd32efe","observation_id":"d75c229d-e26a-4636-9a92-0421d108cc6f","resolution":{"observed_at":"2026-05-16T09:50:00.683764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2401.07669","last_updated":"2026-05-25T19:17:10Z","snapshot_observed_at":"2026-08-01T15:10:33.776201Z","submitted_at":"2024-01-15T13:27:34Z","title":"SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T04:46:18.542521Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2401.07669"},"observation_digest":"sha256:5c24d62d72a5a8f7cc76c71044f4a459097a626fc03387d37937f140e2142dc4","observation_id":"4a47bb5f-7b6b-42c4-8b69-3b555bf773fd","resolution":{"observed_at":"2026-05-24T04:48:54.303371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2503.13821","last_updated":"2026-04-03T20:02:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T01:57:48Z","title":"Stitch-a-Demo: Video Demonstrations from Multistep Descriptions","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T00:30:55.729900Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2503.13821"},"observation_digest":"sha256:1dd5e925151202ca4f79265232573766b6d600c33643e1899be1077ea94795ac","observation_id":"b372a1b7-fd12-4298-83af-85acfe7bdb65","resolution":{"observed_at":"2026-05-23T00:32:18.297596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-08-07T12:45:09.738221Z","title":"and Chen, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24134","last_updated":"2025-05-30T02:09:37Z","snapshot_observed_at":"2026-08-07T12:30:44.442147Z","submitted_at":"2025-05-30T02:09:37Z","title":"A Mathematical Perspective On Contrastive Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:09.738221Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2505.24134"},"observation_digest":"sha256:787d672fb8c2f4225488996a0025b35c18581ce098d98967b9fb25cdfb72d6c6","observation_id":"06498fb3-0c1d-4cf3-921d-2ca0b4ee5cfb","resolution":{"observed_at":"2026-08-07T12:45:09.738221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-08-07T05:35:57.052410Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07572","last_updated":"2025-06-09T09:16:14Z","snapshot_observed_at":"2026-08-07T05:28:06.934011Z","submitted_at":"2025-06-09T09:16:14Z","title":"Learning Speaker-Invariant Visual Features for Lipreading","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:57.052410Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2506.07572"},"observation_digest":"sha256:93e53708640960abcfc5086607828543eda27cd6f2af869be09f0b455ec5cf99","observation_id":"ddea426d-f18b-44c0-99df-70fe5494a31e","resolution":{"observed_at":"2026-08-07T05:35:57.052410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-08-06T15:36:27.471308Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15491","last_updated":"2025-07-21T10:46:49Z","snapshot_observed_at":"2026-08-06T15:28:26.370659Z","submitted_at":"2025-07-21T10:46:49Z","title":"Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:36:27.471308Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2507.15491"},"observation_digest":"sha256:b61dc7e8cb376dee41fd2bc0b58d13bbf9cf14864b40463c0c121c0b5de59fba","observation_id":"475e19fe-8987-4049-afcf-545444f1c113","resolution":{"observed_at":"2026-08-06T15:36:27.471308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-08-06T13:12:39.766732Z","title":"Clip2video: Mastering video-text retrieval via image clip.arXiv preprint arXiv:2106.11097,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-06T13:12:37.106962Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:39.766732Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2507.20939"},"observation_digest":"sha256:f359bafd1043e25ba23d58bec04ccc79a13c38a8e485881db06c5d201edf9350","observation_id":"8adc1884-5841-4d92-9623-872b8dd0785b","resolution":{"observed_at":"2026-08-06T13:12:39.766732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2604.11043","last_updated":"2026-05-12T15:42:58Z","snapshot_observed_at":"2026-07-06T22:59:32.051572Z","submitted_at":"2026-04-13T06:15:11Z","title":"EmergentBridge: Improving Zero-Shot Cross-Modal Transfer in Unified Multimodal Embedding Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:51.162967Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2604.11043"},"observation_digest":"sha256:2f4c30a4fce28cd32cf6ecd965ec1f95a3702b2339788e30dff8ca3774b2d6d3","observation_id":"18390aa0-4e10-4ff7-94b5-3a14c7a0bbbc","resolution":{"observed_at":"2026-05-11T09:41:01.914340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2604.11043","last_updated":"2026-05-12T15:42:58Z","snapshot_observed_at":"2026-07-06T22:59:32.051572Z","submitted_at":"2026-04-13T06:15:11Z","title":"EmergentBridge: Improving Zero-Shot Cross-Modal Transfer in Unified Multimodal Embedding Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T07:16:15.202466Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2604.11043"},"observation_digest":"sha256:5034c97310710ce04eb2d72fdf8f3cc5ccf1a7fda9a92fc9abcd21647c819edb","observation_id":"7bc0539d-8372-4464-8dcb-3e49fe2c6d7f","resolution":{"observed_at":"2026-05-13T07:17:28.665420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2605.00051","last_updated":"2026-04-29T15:29:19Z","snapshot_observed_at":"2026-08-02T05:45:46.015951Z","submitted_at":"2026-04-29T15:29:19Z","title":"Learning from the Unseen: Generative Data Augmentation for Geometric-Semantic Accident Anticipation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T20:04:39.623342Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2605.00051"},"observation_digest":"sha256:d4a55d7de2dffbe4792d7a6b8ce73bab3bd31b1f9facfeea339c78764c280f35","observation_id":"15cdf844-dbd2-4316-8418-c8d476152921","resolution":{"observed_at":"2026-05-11T15:26:08.314300Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":"2106.11097","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","venue":null,"work_id":"8d25e9b6-c6a3-4d5e-986c-928a46f87903","year":2021},"citing_paper":{"arxiv_id":"2605.00826","last_updated":"2026-03-07T12:28:35Z","snapshot_observed_at":"2026-08-08T07:16:50.125784Z","submitted_at":"2026-03-07T12:28:35Z","title":"Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-15T15:05:37.964883Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2605.00826"},"observation_digest":"sha256:3ed7ad909e7428232367196fe5d45a1e77153bf1fbc0209c3691fb0a52e6b421","observation_id":"e7f17c4f-79fc-4248-98ae-e47fbf162147","resolution":{"observed_at":"2026-05-15T15:06:09.640974Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-07-13T04:19:16.924621Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09263","last_updated":"2026-07-10T10:26:38Z","snapshot_observed_at":"2026-07-15T23:18:08.725737Z","submitted_at":"2026-07-10T10:26:38Z","title":"Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-13T04:19:16.924621Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2607.09263"},"observation_digest":"sha256:dd0e1b68b3d49a08dbb1cfc3b6cd7b2b121642454d9e688a7d55bd2c2e5f82dc","observation_id":"599e28ca-8d4e-46ce-9590-96fdadc8c36b","resolution":{"observed_at":"2026-07-13T04:19:16.924621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11097","snapshot_observed_at":"2026-08-02T01:01:00.942499Z","title":"arXiv preprint arXiv:2106.11097 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14821","last_updated":"2026-07-16T10:39:22Z","snapshot_observed_at":"2026-08-07T23:46:00.212599Z","submitted_at":"2026-07-16T10:39:22Z","title":"Blurring Modal Boundaries: A Unified Survey from Single- to Multi-Modal Person Re-ldentification","version":1},"reference_index":154,"source":"pdf_text","source_observed_at":"2026-08-02T01:01:00.942499Z"},"links":{"cited_paper":"/paper/2106.11097","citing_paper":"/paper/2607.14821"},"observation_digest":"sha256:c388437ce18f1d1815b575314ccfb86e5f0c4b9a20eff0bdf7e3abf8549ce84d","observation_id":"8de72bdb-d372-4f2c-9b39-7a4f0850d79a","resolution":{"observed_at":"2026-08-02T01:01:00.942499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2106.11097/citation-record","integrity":"/paper/2106.11097/integrity","json":"/paper/2106.11097/citation-record.json","paper":"/paper/2106.11097"},"outbound":[],"paper":{"arxiv_id":"2106.11097","last_updated":"2021-06-21T13:30:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T10:19:49.212509Z","submitted_at":"2021-06-21T13:30:33Z","title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2106.11097."}