{"as_of":"2026-08-02T03:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:567f2ef379b059f1e5614aa5b9a7e3bfb8842a4e3cbac29bebb0aecbc4c76891","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T20:13:41.533598Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.26763/citation-record","integrity":"/paper/2603.26763/integrity","json":"/paper/2603.26763/citation-record.json","paper":"/paper/2603.26763"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"near-raw,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:69e62fd5ff5e517d6f4d3286e6656ba990adddd39b4876263491947e0e0e8c9c","observation_id":"80836f1c-d6f0-43f9-a622-ba58098ccfae","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:5829a168b705894d1f123e4031182c5d5f322bee8e693f35674484f7f07d5544","observation_id":"994ac37f-1c34-4363-8b0c-8850b6ac1ec7","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:9d8a3a5bcff4cdfab17eebac702a796563d01844a60cdfbfc7d1b335baaf9e29","observation_id":"7a043387-2c74-4c84-b61f-c39ff3187c56","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:e06b6e7093bace8c81c5262dadfc84f101b78a1875c4ebdaf19725ac9be9cd06","observation_id":"49f36493-99b3-4efc-9f67-1b6affb55634","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"near-raw","venue":null,"work_id":null,"year":1920},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:d777593350ec41f23be4c88b1502d280c0d7e3d0def9626d6bc920f0f9964bb7","observation_id":"6b7de09c-2489-4197-a93c-f4a164d6ba46","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:36a9b6ac22f892918b5870b8fb9d233f8a6d52017f3ee769b147f9acf8454c87","observation_id":"06fad653-adb6-4d77-b734-59303b16f31d","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"VCD: A Video Conferencing Dataset for Video Compression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:da3f0be0757c9ecdd248aa0552d794b0dc8b52a7f77f80dd3802b00d7c30f5d5","observation_id":"d745759c-88e2-4bf2-8baf-e105aad7763e","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"VFHQ: A high-quality dataset and benchmark for video face super-resolution,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:133c0192ba6639da17ed0ffed06aa21d022336793e811d424712e7257a303d23","observation_id":"a7594676-ee4f-47b4-9183-46fc254d4e84","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Common test conditions and software reference configura- tions,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:3d1f85ded602f01e93119a1f9fe9d7cf95b7e7207c2bbccb9d80560e64c737d5","observation_id":"6b91a5f0-90a0-46af-8f60-f107b67ce0e5","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"JVET common test conditions and software reference configurations for SDR video,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:bebe2f9013773370e8614e43c9dc103a9440ba1799bc4e076d86f61c424d6a17","observation_id":"a5a5b3a8-1671-4f9a-a494-09c34ad30b7f","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"UVG dataset: 50/120fps 4K sequences for video codec analysis and development,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:d637dac65edab6a18d89aefb0c76c4f8f16dab2e4f5d29c163e4b344b3f8b85c","observation_id":"1176eccc-3312-409d-8792-3908a299fe42","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"MCL-JCV: A JND- based H.264/A VC video quality assessment dataset,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:fd9b5a5fad493d98142bb3c0a2a8a10165f97775a74583af3bb0ce7fe84081fc","observation_id":"ceb317ba-6f51-437c-ba33-f20e89b1bf62","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-07-06T05:48:32.602384Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"V oxCeleb: a large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:42f5606ac05d5274561bfab8749886a9ecf3227a1423ffdbfe3cd0ea2e908d1d","observation_id":"415c7d77-473a-4142-aef9-8bd4bcf10254","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"V oxCeleb2: Deep Speaker Recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:a340f405dc6a331d73cb588be41e5ba00cbc82ad1228c25405fbadd81123b455","observation_id":"a94eaa98-e54e-44b0-93bd-f0b7c76d6e76","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:fba88184e8dd01b0f18cd6d1eb402698d016f0dc9ee10e72b2d21e25c9ec77ac","observation_id":"95e4189b-7f6d-4eca-8819-1ddedf1b82f9","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"CelebV-HQ: A large-scale video facial attributes dataset,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:bb04a95512ef2b8ae5dc529965aa45d153d5263c63177a9ecb520370a935e2ad","observation_id":"215d437b-738c-4e3c-82e3-eb2b1dfdef8c","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"DH-FaceVid-1K: A large-scale high-quality dataset for face video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:6c0425edd296af872cfb06b76dbd17256a68e93e167859c10915991a60f5dcb6","observation_id":"0e5250d8-59aa-4001-8854-d8a38d99c336","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"MEAD: A large-scale audio-visual dataset for emotional talking-face generation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:a0a003955d0865ff5c9b50f3fbaf7401dabcc670ffd37899df2870ddcedd4970","observation_id":"08648543-e79b-4006-abe3-ed70c2e0d8f3","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"FaceForensics++: Learning to detect manipulated facial images,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:117df91688f49fadc7d589555d4629a37d484f5f30a7ce97d2a71880d0115bda","observation_id":"72cd0ea9-ef4f-440b-bae7-2695d8c12751","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"NTIRE 2019 Challenge on video super-resolution: Methods and results,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:4e561b998f8384ce1207aac1565768f60e4efc6c0c44940691a5a9da649e271a","observation_id":"8a67f7d5-29ee-42a8-9e67-7f9c1d530be5","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"EDVR: Video restoration with enhanced deformable convolutional networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:86137756da58f8b9f2072b664f3f268440e2c85af5d168c54bdeb98c8071cb00","observation_id":"a21dd68d-ef39-4a90-a9fd-7ad4c790b9e8","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Basicvsr: The search for essential components in video super-resolution and beyond,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:8d59290e38a841f48b815f7a694fb5fbcb84d86345283f584a9b6bbfc55f33f0","observation_id":"a3bedc00-17b2-4434-8dd6-799c6a2e0f17","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Basicvsr++: Improving video super-resolution with enhanced propagation and alignment,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:c9ff0f2685a68d7afb91a985c8938d54e635d92dd4cd5d2c456b5018fc156e12","observation_id":"9a63607a-5b84-4a51-9905-42f88897d577","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Real-world video super- resolution: A benchmark dataset and a decomposition based learning scheme,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:50ea4bb70e88d9be0aed41252e1f8fef76ca03bbf1712a53801d11e9a0e28071","observation_id":"112b6ff8-60fe-4749-93b6-3932bab486d1","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Investigating tradeoffs in real-world video super-resolution,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:569e65e2435f0a54600aece169bb042e65da1e9876f61e9092055bea47f87783","observation_id":"8e093ec4-48b6-4f37-850c-92f3750c5f8a","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Generative face video coding techniques and standardization efforts: A review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:769d92e946d093ed17ba84f621081590f848e2db1904fc058aa0f2343ba30269","observation_id":"71be2ad1-7d78-4db8-8dc7-e13733e0eab7","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Gemino: Practical and robust neural compression for video conferencing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:a91416f348edf308bba1c12f8eb7d5ad2d25ab677c40fb90869228f2c6c4eed7","observation_id":"08eea192-6557-4469-9fc1-241359511937","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Overview of the H.264 / A VC Video Coding Standard,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:3c086400796a444b331580e2f08c42a6920c24fa5dd1cfb78f02328735f99b95","observation_id":"bbaaa54d-8aa9-47fe-b9ef-ea548e542f72","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Overview of the High Efficiency Video Coding (HEVC) Standard,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:65d166337dd3c9804d3cc6ce056f7d91a4bec8b6b5ce0ee018292f36da592a76","observation_id":"0031b3a3-1c1a-4a7f-bfb1-a05a4b6e9b45","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Overview of the Versatile Video Coding (VVC) Standard and its Applications,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:a002e980c69abac54497c6660de664643bba8d84284c6f1746fe864753c19bb3","observation_id":"461be69b-54c7-4a85-9396-a31e7427f51d","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"A Technical Overview of A V1,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:78854165f64bfa025362c7d258e4205a664d123febc9f87bd3e8b49820db9fb7","observation_id":"6b250666-ec17-4849-bee4-37be859d351c","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"FFV1 video coding format versions 0, 1, and 3,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:c96725dc85fea41b28baed96bda114c8c7c13ff6eb168fb39d08065b3403e92f","observation_id":"ceef4cc9-82bb-48c2-82ee-a0da208ab03d","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"A crowdsourcing approach to video quality assessment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:722966b8c6b75da5f6e5a14e2384f3f277b0749b80c04b630d23904ec3c26bdf","observation_id":"f42a1901-4298-418e-8045-806464de88ed","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Crowdsourcing Quality of Experience Ex- periments,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:ecc5874d693d2d0c7072c473949a217f57117a9517ba212c238fb50700bec13d","observation_id":"15297ef8-cf7c-485f-91cb-2409b99a3a4b","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"CROWDMOS: An approach for crowdsourcing mean opinion score studies,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:28b552f691c2cdc444cdcd06c5b9c1ab07088868db3ba6de961c2f5079fbf4fd","observation_id":"576f64bc-5203-4157-b20b-327617adb97c","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"The Ishihara test for color blindness","venue":null,"work_id":null,"year":1924},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:b909356007192d42365eae7bd8262781610a7526714c16a2ddd5ebe56020c037","observation_id":"11ab77f6-363c-4cbd-b932-2923a726ae08","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"An index of factorial simplicity,","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:188986f6fd3d8b7ffa59f1728ff3becc072112e162339e82cba4bb955e2ec5db","observation_id":"c263441b-6e64-4758-8f51-7ad7c0ebee12","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"Calculation of average PSNR differences between RD-curves,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:a18ab05a1eedfff4500304e4e65052b1b2a13b30c393dd18dda5419450a37c13","observation_id":"dacef736-3fa4-4582-98ee-3be90df06a7f","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"VMAF: The Journey Continues,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:835132bfd2697fc052ac867fa7f067c2e5d7528f51b1b8ad7cb18d285dede58a","observation_id":"bc408c49-eb0d-4d74-be47-2298fa4019c9","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:13:41.533598Z","title":"WebRTC video processing and codec requirements,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T20:13:41.533598Z"},"links":{"citing_paper":"/paper/2603.26763"},"observation_digest":"sha256:c7536beeb70317f59e823a87fb0a931721434e2aac53d4ef71e8bd395ded98b7","observation_id":"b820cd30-5e1c-4f24-ac67-428c93112e68","resolution":{"observed_at":"2026-07-13T20:13:41.533598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.26763","last_updated":"2026-06-08T16:17:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-30T13:32:38.851549Z","submitted_at":"2026-03-23T20:51:35Z","title":"A Camera-Native Talking-Head Video Dataset for Various Computer Vision Tasks"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2603.26763."}