{"as_of":"2026-08-18T08:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:023a5e4a6267a880d6b28588ddc93235af40c0c3694e9fe6af6e892cb1be3ea0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:38:29.887712Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T00:57:54.277877Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.02824","last_updated":"2021-01-14T10:34:56Z","snapshot_observed_at":"2026-08-16T19:15:28.720622Z","submitted_at":"2020-10-06T15:38:54Z","title":"Support-set bottlenecks for video-text representation learning","version":2},"cited_work":{"arxiv_id":"2010.02824","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.02824","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Support-set bottlenecks for video-text represen- tation learning","venue":null,"work_id":"34338423-25b4-44c0-9b71-743bbf04bfc8","year":2010},"citing_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-08-13T04:37:51.649726Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-16T09:50:00.546571Z"},"links":{"cited_paper":"/paper/2010.02824","citing_paper":"/paper/2204.00598"},"observation_digest":"sha256:60c9ffbae04bde022e8d7194a120037b76e44a5a94a05a7f68359cc615b45167","observation_id":"90adf58f-9669-4d47-ade0-c3a7a616764a","resolution":{"observed_at":"2026-05-16T09:50:00.785863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02824","last_updated":"2021-01-14T10:34:56Z","snapshot_observed_at":"2026-08-16T19:15:28.720622Z","submitted_at":"2020-10-06T15:38:54Z","title":"Support-set bottlenecks for video-text representation learning","version":2},"cited_work":{"arxiv_id":"2010.02824","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.02824","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Support-set bottlenecks for video-text represen- tation learning","venue":null,"work_id":"34338423-25b4-44c0-9b71-743bbf04bfc8","year":2010},"citing_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-16T17:54:32.088103Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"reference_index":178,"source":"arxiv_source","source_observed_at":"2026-05-17T03:27:58.952076Z"},"links":{"cited_paper":"/paper/2010.02824","citing_paper":"/paper/2310.01852"},"observation_digest":"sha256:7ba37de94722691f244f0d279a1e6f9d1cc5527358983b87924d52c319528391","observation_id":"cfd47800-1fde-4505-afc6-4a43caf361b0","resolution":{"observed_at":"2026-05-17T03:27:59.126381Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02824","last_updated":"2021-01-14T10:34:56Z","snapshot_observed_at":"2026-08-16T19:15:28.720622Z","submitted_at":"2020-10-06T15:38:54Z","title":"Support-set bottlenecks for video-text representation learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02824","snapshot_observed_at":"2026-08-15T20:38:29.887712Z","title":"Patrick, P.-Y","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.12489","last_updated":"2025-05-21T04:44:19Z","snapshot_observed_at":"2026-08-17T20:11:15.369850Z","submitted_at":"2025-05-18T16:22:58Z","title":"Video-GPT via Next Clip Diffusion","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:38:29.887712Z"},"links":{"cited_paper":"/paper/2010.02824","citing_paper":"/paper/2505.12489"},"observation_digest":"sha256:4bfd68d41f29bde5448b09362cea6eb0bcf39f731a6f5eb09cc138e8e8bcfca2","observation_id":"f24207b3-fefb-4c54-bafe-26dd995e3060","resolution":{"observed_at":"2026-08-15T20:38:29.887712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02824","last_updated":"2021-01-14T10:34:56Z","snapshot_observed_at":"2026-08-16T19:15:28.720622Z","submitted_at":"2020-10-06T15:38:54Z","title":"Support-set bottlenecks for video-text representation learning","version":2},"cited_work":{"arxiv_id":"2010.02824","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.02824","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Support-set bottlenecks for video-text represen- tation learning","venue":null,"work_id":"34338423-25b4-44c0-9b71-743bbf04bfc8","year":2010},"citing_paper":{"arxiv_id":"2605.17959","last_updated":"2026-05-18T07:17:14Z","snapshot_observed_at":"2026-08-17T11:56:06.551954Z","submitted_at":"2026-05-18T07:17:14Z","title":"Text-Video Retrieval With Global-Local Contrastive Consistency Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T00:54:38.366362Z"},"links":{"cited_paper":"/paper/2010.02824","citing_paper":"/paper/2605.17959"},"observation_digest":"sha256:2ab09250dffbd3fb1f6e3e2b5b13f4490615a845224476828758c6a8f09d196e","observation_id":"aaee5621-4374-4877-9ee5-ba1c57020510","resolution":{"observed_at":"2026-05-20T00:57:54.279617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02824","last_updated":"2021-01-14T10:34:56Z","snapshot_observed_at":"2026-08-16T19:15:28.720622Z","submitted_at":"2020-10-06T15:38:54Z","title":"Support-set bottlenecks for video-text representation learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02824","snapshot_observed_at":"2026-08-01T08:52:14.620675Z","title":"arXiv preprint arXiv:2010.02824 (2020)","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.20984","last_updated":"2026-07-23T07:07:28Z","snapshot_observed_at":"2026-08-06T22:09:00.863278Z","submitted_at":"2026-07-23T07:07:28Z","title":"Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T08:52:14.620675Z"},"links":{"cited_paper":"/paper/2010.02824","citing_paper":"/paper/2607.20984"},"observation_digest":"sha256:f6d423edd6793e22dfb43a47367268298157ed4bc5cda89b0c63da07f30ef517","observation_id":"a08891ad-9d3f-4306-91ca-4d9f64acec0c","resolution":{"observed_at":"2026-08-01T08:52:14.620675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02824","last_updated":"2021-01-14T10:34:56Z","snapshot_observed_at":"2026-08-16T19:15:28.720622Z","submitted_at":"2020-10-06T15:38:54Z","title":"Support-set bottlenecks for video-text representation learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02824","snapshot_observed_at":"2026-08-05T00:46:15.858499Z","title":"Patrick, P.-Y","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.00551","last_updated":"2026-08-01T09:08:21Z","snapshot_observed_at":"2026-08-15T17:03:02.731938Z","submitted_at":"2026-08-01T09:08:21Z","title":"PHA-Net: Prototype-based Hierarchical Alignment Network for Text-Video Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T00:46:15.858499Z"},"links":{"cited_paper":"/paper/2010.02824","citing_paper":"/paper/2608.00551"},"observation_digest":"sha256:3b044bb2d6fff5d9c4be350954387fbc09468fbd323bba8acd872c0cee10e783","observation_id":"662ff6e2-ac5c-4e03-a796-e992759c5945","resolution":{"observed_at":"2026-08-05T00:46:15.858499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2010.02824/citation-record","integrity":"/paper/2010.02824/integrity","json":"/paper/2010.02824/citation-record.json","paper":"/paper/2010.02824"},"outbound":[],"paper":{"arxiv_id":"2010.02824","last_updated":"2021-01-14T10:34:56Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T19:15:28.720622Z","submitted_at":"2020-10-06T15:38:54Z","title":"Support-set bottlenecks for video-text representation learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2010.02824."}