{"as_of":"2026-08-20T05:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75dd9ce007e3b0629b3745b201a9a45b3cb45af36ab9fb681b13af0e1329c021","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:10:51.357615Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.05758/citation-record","integrity":"/paper/2502.05758/integrity","json":"/paper/2502.05758/citation-record.json","paper":"/paper/2502.05758"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.061404Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.061404Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:1067a1b14333f4d263ed458ab3a5b86d869227d73cd0049a56ba6b5792d26ac0","observation_id":"1c4cf320-e7f0-42aa-b2f1-93a45da96e8d","resolution":{"observed_at":"2026-08-08T18:10:51.061404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.959870Z","title":", author Chung, J.S","venue":null,"work_id":"05fa090c-a579-47bd-b6dd-3e5820d2b87d","year":2022},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.066155Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:d0e92b5b1454f450a7e9bd6eaeb41c90c9b7b6f518653eec50a80cb67cc5a993","observation_id":"4c85d854-f630-421a-8674-2c813bfb46fb","resolution":{"observed_at":"2026-08-08T18:10:51.962677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-08-16T06:08:36.265981Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-08T18:10:51.070411Z","title":", author Chung, J.S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.070411Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:2527194be71d82da9c91eb186b5f503ac1f0bf71abe6a7ac8d04d919ce434e3e","observation_id":"ff9c9cde-afc1-4ce0-9373-1d253ca4e0b8","resolution":{"observed_at":"2026-08-08T18:10:51.070411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.951640Z","title":", author Chung, J.S","venue":null,"work_id":"bb497b9a-0964-4862-a134-966ab8450abd","year":2020},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.074980Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:92c0a885712cd01f28dc84b502be2bddd9fb6266954b8eb236ed9b0249f30121","observation_id":"0635d9fc-7aec-46d1-9338-05496449e294","resolution":{"observed_at":"2026-08-08T18:10:51.954472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.943334Z","title":", author Park, J","venue":null,"work_id":"b78568a3-2220-4484-a75d-899b342d42c1","year":2024},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.078387Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:313feb163e148103125e937f0ad15fb507666963bc86a18f9f89560f7d3f255a","observation_id":"95b6e2b0-0119-48a8-8465-aeb2b4e081b7","resolution":{"observed_at":"2026-08-08T18:10:51.946407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.934492Z","title":", author Zhou, Y","venue":null,"work_id":"43f037f2-60d3-453b-81e6-e3714a942520","year":2020},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.083250Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:6872775805580cb39857044ef35e286155818798327dbb2159c478a89a92a343","observation_id":"c1160bd6-0bd9-480d-b98b-6141de5c87db","resolution":{"observed_at":"2026-08-08T18:10:51.937316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.926362Z","title":", author Fainberg, J","venue":null,"work_id":"c49c0acd-a65c-4b40-9d7a-062aa53a263f","year":2020},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.086718Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:386435b3a8638e8331f55190d868500f23b2efdbf908195f823bba49bb97921a","observation_id":"48952383-562c-4750-9b7a-1e8f093644f9","resolution":{"observed_at":"2026-08-08T18:10:51.929221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.918133Z","title":", author Ney, H","venue":null,"work_id":"3e5b9417-7eae-4874-891b-05c22e8ed2a8","year":2004},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.090311Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:493ce5f5c8005ef714ec000865611a2d623a3c6b9d70cd7fa880ed02a088b87e","observation_id":"a112d982-865b-4d2f-aaf7-6ab1a1bd36e1","resolution":{"observed_at":"2026-08-08T18:10:51.921267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.909087Z","title":", author Wang, D","venue":null,"work_id":"e81416af-4ee1-486a-b4fb-58dfaed20340","year":2023},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.094908Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:56726e4a17265fc9bb86140d21bce6e97770248f6557345b38d4dcf8c8ca9bef","observation_id":"15246a33-2ff0-48d0-81fa-ef0372b8372b","resolution":{"observed_at":"2026-08-08T18:10:51.912948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.900046Z","title":", author Zhou, H","venue":null,"work_id":"e178fe7e-fe09-42f8-852c-0e632bf2ddbf","year":2022},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.098271Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:6d127473a6e33016e9cc9e075d56231f25e5b6c783c9418efdfced9cad95071c","observation_id":"7924981a-03b9-4a9a-9c43-0df7652fcec3","resolution":{"observed_at":"2026-08-08T18:10:51.903846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.891180Z","title":", author Schultz, T","venue":null,"work_id":"5ed951c6-c717-4e26-9b70-c70d694786c7","year":2010},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.101751Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:ec96e32ef452318ffcec806a170d31f763f8f82be5fe57d85933d6fb4a63e5d9","observation_id":"b83ddb41-e456-4eca-afc6-f851404af26b","resolution":{"observed_at":"2026-08-08T18:10:51.894219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.882871Z","title":", author Luettin, J","venue":null,"work_id":"fc788a33-3263-400a-9041-dca543ebf199","year":2000},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.166204Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:80f906872366fabc3c4f45888e0a3e14aaec25a74f4b01ae4d6ac7e5faba1ecc","observation_id":"a7531c06-f4db-4082-ad44-07adfeb6048d","resolution":{"observed_at":"2026-08-08T18:10:51.885775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.874916Z","title":", author Mart \\' nez-Hinarejos, C.D","venue":null,"work_id":"3e1a58d8-b72b-488d-b26f-8c5d32200a5a","year":2023},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.169849Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:c7acab7bea550deef830b46f6545c880cc3dbf2eb6c3c1006615a3012090356e","observation_id":"1f86d827-7509-49dc-924d-2243b8267eef","resolution":{"observed_at":"2026-08-08T18:10:51.877763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.866036Z","title":", author Ma, P","venue":null,"work_id":"edafe14b-fd87-4790-a356-7588000ea9e7","year":2023},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.174298Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:b2b1c51a56fc9a9bec488c32e2360b0594ff35a5ce1d318cfcbf652604eac032","observation_id":"fc48d94b-a806-4cbb-9528-b63fbf0ee089","resolution":{"observed_at":"2026-08-08T18:10:51.868854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.858024Z","title":", author Bolte, B","venue":null,"work_id":"77992ee9-ed96-42a3-82c9-e6e625e57b3b","year":2021},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.177977Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:dd9220f84a8dc33656243a97be642112d703b828317fda0fc837d1288754e6a4","observation_id":"44620d3c-1ee3-488a-8894-ec7d9937de11","resolution":{"observed_at":"2026-08-08T18:10:51.860996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.848837Z","title":", author Shi, B","venue":null,"work_id":"558796d0-ee94-464a-a5f5-4340357c3654","year":2022},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.181352Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:4d675e2738957e619e27fe8f7c744fab396bbec08bfb19d9d6a3da8f036de817","observation_id":"8b351644-e1a9-436b-b7cd-0519a8713171","resolution":{"observed_at":"2026-08-08T18:10:51.851878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.840625Z","title":", author Li, J","venue":null,"work_id":"5eb1d00e-7ce7-42e5-aaf2-35a08a999a71","year":2020},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.185560Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:8ee4008ac2392f7657f1fb39fd3a497e20ee84b2e80c90d0c4c88f49ba111a11","observation_id":"18f8e293-aa88-40ec-8429-f4318ba015af","resolution":{"observed_at":"2026-08-08T18:10:51.843578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.832428Z","title":", author Tran, D","venue":null,"work_id":"dcc98f8f-b202-47da-a99c-e8b5b7406aea","year":2018},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.189739Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:d52d43f3503e72a3575a3492b27483b4e391cb104fd61d2cc9bc304ab5697d00","observation_id":"50573e2a-0ef7-4ea8-abca-1dbd38a18a13","resolution":{"observed_at":"2026-08-08T18:10:51.835448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.823813Z","title":", author Lee, E","venue":null,"work_id":"77ec7af9-5118-42d1-98e1-3ed1cc848c41","year":2004},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.193222Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:920cfb18f758b8f4c6ddded18db31c4fd9405624af797dc0f4d80c6e68f6123a","observation_id":"1355b5c5-f864-4758-8bdc-9f68eae18999","resolution":{"observed_at":"2026-08-08T18:10:51.827137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.815646Z","title":", author Li, J","venue":null,"work_id":"e960ad30-4945-4847-881e-76627975c763","year":2018},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.196782Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:54792f3e7038c98b6fcb5cd147886d1158a602e4e9cf6c1d0bb5e16d21d52f40","observation_id":"8d98772e-b445-4211-95cc-6cadb227e586","resolution":{"observed_at":"2026-08-08T18:10:51.818596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.807401Z","title":", author Baevski, A","venue":null,"work_id":"26f2ce01-8c11-4841-8b1c-70ad10a3203f","year":2023},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.200282Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:f069d524393c6571469c1738aebd614f05b07f3705376e22ff13afbb738ae3bd","observation_id":"231e4a57-0931-4231-a568-fd749e17fc6f","resolution":{"observed_at":"2026-08-08T18:10:51.810382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.799244Z","title":", year 2013","venue":null,"work_id":"0d4ec55c-34e5-4644-b37b-789bcc64b1a9","year":2013},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.203881Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:73142a7240c13b83ccdfd8a05590cb645f47df8b5a168c901bc33b5007e7fcb8","observation_id":"d5b219bb-59d1-40c9-808e-528685bf6d3e","resolution":{"observed_at":"2026-08-08T18:10:51.802078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.791034Z","title":", author Lakomkin, E","venue":null,"work_id":"0d8e8c1e-2c64-4f58-ba16-4430459b4652","year":2023},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.207206Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:603c430f2b48153b07265c8c762fb2e26c04e2d597f6f66f5148a06bbad39992","observation_id":"987c8eb7-4b4f-4ba5-8064-1ce7a4ca24c6","resolution":{"observed_at":"2026-08-08T18:10:51.793940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.782888Z","title":", author Martinez, B","venue":null,"work_id":"9b3fffe5-b50a-44e8-af16-50cbe4e218ba","year":2021},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.211169Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:82fff4203565bdaae71e098126f39c4d45f54ac5e2a6e678962c45f8f231c88d","observation_id":"7bf95f38-dae2-44c6-89fd-16e531f50553","resolution":{"observed_at":"2026-08-08T18:10:51.785966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.774249Z","title":", author Mira, R","venue":null,"work_id":"3998d52d-8be1-4a26-aa9b-f1244b8d0f01","year":2021},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.214627Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:4aef7474ddc0a630018ebcc003bab750a171ced7504efd3f00d711e699fbe555","observation_id":"dd876f3a-b5bf-4dc9-b3b5-b47975bd13f7","resolution":{"observed_at":"2026-08-08T18:10:51.777647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.765128Z","title":", author Petridis, S","venue":null,"work_id":"bfa515be-4e6f-4eaa-84b6-4f21258a6b7b","year":2021},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.217536Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:414b1631604e1a67df6ee0e4ec5e25e3ecc29c33cdbc4c0f1a732738b85c5ce9","observation_id":"17aff323-7f4b-4b16-b026-d49e537da295","resolution":{"observed_at":"2026-08-08T18:10:51.768361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.755850Z","title":", author Petridis, S","venue":null,"work_id":"d1d14ad8-34fd-44d2-9246-971fe54ee6c4","year":2022},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.221726Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:8f88f699667b2a1cbd17ff41e41d3affbc4f0e6fa410fd167e666ec773f784af","observation_id":"d2bfd4db-2825-4e71-b0a4-66055fc52622","resolution":{"observed_at":"2026-08-08T18:10:51.758831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.747160Z","title":", author Wang, Y","venue":null,"work_id":"f017da9d-1e28-4e65-9547-1c8177b6cfa9","year":2022},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.225348Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:1168ce6a7dd05f14929984ea80d1368f67c81f8fc33438e9efc064a014e2552b","observation_id":"018169a8-0431-448f-8fa9-6af0015e97d5","resolution":{"observed_at":"2026-08-08T18:10:51.750096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.738133Z","title":", author Zeng, Z","venue":null,"work_id":"0426c9fb-1c71-4b7f-85d7-21d63866bf11","year":2021},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.228826Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:f61903b4966159bab86701cdd73a84543865614dc036f7e5228ee90ba8f9abb4","observation_id":"8c3a79f2-6078-47c8-af30-468d23c37faa","resolution":{"observed_at":"2026-08-08T18:10:51.741152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.729098Z","title":", author Liao, H","venue":null,"work_id":"285c9b4e-d1d7-47e1-9ef6-5c3bec548148","year":2019},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.231949Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:a61d0fa06c0046e5e47fa508fd7526f32878d01c0090ea43b3a200d0f970772b","observation_id":"f70055f0-268b-43bd-8135-e37ae06dc769","resolution":{"observed_at":"2026-08-08T18:10:51.732348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.720223Z","title":", author Ma, P","venue":null,"work_id":"108a3430-779d-4559-8242-3907be8e7681","year":2020},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.235798Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:9c954c74334e1238c9ff45d49a04079015c646724cae3f7bc34d064f7955ad64","observation_id":"171d9410-bc21-47b4-81a2-1081573738d8","resolution":{"observed_at":"2026-08-08T18:10:51.723487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.711239Z","title":", author Gaur, Y","venue":null,"work_id":"e0ae41fc-0f69-477d-b167-50e6c9023bf9","year":2019},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.239322Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:b7405f7b224f915c2429d87376250613c53fb78000e4768d846e19fb49e50e15","observation_id":"e7452af4-510d-4753-b0f5-29bf9c635b61","resolution":{"observed_at":"2026-08-08T18:10:51.714209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.703030Z","title":", author Yamaguchi, Y","venue":null,"work_id":"5dc7b6e9-c0e0-4215-88a3-02e3524f52ef","year":2014},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.243945Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:59fc2ceaa83fc5668025ea7b6f0f1317a9520ab2a58c7c826dc1b98fcb33d55b","observation_id":"5f635435-fc51-4a92-96e7-6aaf61e3eb1f","resolution":{"observed_at":"2026-08-08T18:10:51.705889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.694862Z","title":", author Dalmia, S","venue":null,"work_id":"ad13e5bb-3b6f-43d2-a530-6462dc4671e8","year":2022},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.247981Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:4ed8d89f10aeee2d2e57f6ab256ba02b0c8a351caa8371ebef87d3ea7a550747","observation_id":"e9fddcc8-e888-414a-9262-d98e72515995","resolution":{"observed_at":"2026-08-08T18:10:51.697825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.686792Z","title":", author Stafylakis, T","venue":null,"work_id":"1f3bbc67-5778-4eb4-afb7-4f9a04f61e17","year":2018},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.252919Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:502e2af8e28fbd03f882060e55eb249c9d412864861fd40730f9742a57957d39","observation_id":"ce046248-7676-41de-b44e-da5804b68300","resolution":{"observed_at":"2026-08-08T18:10:51.689626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.677960Z","title":", author Stafylakis, T","venue":null,"work_id":"9832a8df-2111-4875-b920-0fdc67f2fb5f","year":2018},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.257135Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:74c2aef76eaba4dfb35a3be2af98507f24540a13ad0ece04a3a1fe6318cf8a86","observation_id":"5774ddfb-4e3e-4f9a-98be-92e4fcad53ed","resolution":{"observed_at":"2026-08-08T18:10:51.681540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.669951Z","title":", year 2012","venue":null,"work_id":"8b04fdb5-1c79-4a7f-9443-8d537e69f8f2","year":2012},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.260248Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:ba70f98afd1ab2f352f747c7bbc4dda9f8a6794d82cc92c640159576ef5fab58","observation_id":"1af67933-885b-4fde-a213-d962f4a5e08a","resolution":{"observed_at":"2026-08-08T18:10:51.672761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.660590Z","title":", author Afouras, T","venue":null,"work_id":"8af7d7cc-f1f4-46c5-9885-5cc3f3e334a8","year":2022},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.264033Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:2f8539679a94c2730bf72ffac80921b17df8fe4f9d041aea568a9303bdd624ef","observation_id":"7c1bb8c6-2b81-4d4c-947a-4dc006064a65","resolution":{"observed_at":"2026-08-08T18:10:51.664631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.651921Z","title":", author Axyonov, A","venue":null,"work_id":"8164ec32-94d7-4487-820c-491215517369","year":2024},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.267039Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:b649d2c2deb997f4ce65fd25c66e04c8b0cfa66250521686f32bb967a16d413e","observation_id":"b17e23ab-ab1f-4b6f-869c-466dece0abcb","resolution":{"observed_at":"2026-08-08T18:10:51.655237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.642873Z","title":", author Ivanko, D","venue":null,"work_id":"b924fef0-369f-49f6-a5bf-6f2d7527d424","year":2023},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.270779Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:2af09ec976d1af679ea451390abb34144f271abc9b23b4fb360b140bb3b266e7","observation_id":"36fccf87-bd7e-4f84-9197-fff325abee52","resolution":{"observed_at":"2026-08-08T18:10:51.646481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.632930Z","title":", author Sim, K.C","venue":null,"work_id":"9c00a5d4-2323-4389-a7bb-0493e8ff4085","year":2016},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.273865Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:af587ba360033218b7a67692dbf29452f619266de956986933a04cbb4697ac7b","observation_id":"5a51b673-99af-4048-a270-ffd261fc9434","resolution":{"observed_at":"2026-08-08T18:10:51.635844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.622656Z","title":", author Moritz, N","venue":null,"work_id":"6df30888-9a4b-4cca-83d0-16ed24757447","year":2020},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.277936Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:47f128da9ddea730d11dc7bc928fbf89f7d2f25e7ff2fcdd2f474e969c9eca6f","observation_id":"cf1d6912-4dae-4132-a5f2-cdc4d2ddf29b","resolution":{"observed_at":"2026-08-08T18:10:51.626197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.611787Z","title":", author Braga, O","venue":null,"work_id":"a9be090e-7836-4a34-ac99-cd9321f080f6","year":2022},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.281446Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:58075c602c12bfd939d6f0d9ced8c52f98da4febd466c6b0fba86665c76356de","observation_id":"b813334d-ad70-488a-b0a4-c23dc7e40520","resolution":{"observed_at":"2026-08-08T18:10:51.616018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.602043Z","title":", author Hsu, W.N","venue":null,"work_id":"f2910418-5889-4e77-b382-8e4cf0ceb3ba","year":2022},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.284655Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:a45cd5f53b4850e0714d731b0fa8fb10d5c6abe1b97912aff9f48c39706d0dd2","observation_id":"8cd72223-3cbb-40f8-87b7-324f186c2b2f","resolution":{"observed_at":"2026-08-08T18:10:51.605453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.591774Z","title":", author Senior, A","venue":null,"work_id":"877885c9-4c5f-4ab2-b999-25bbea637815","year":2017},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.289115Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:b3d6b5a8d4055d5bf8c6f5e75145c9e66463bb854e33e67a75b86c3708dcaccb","observation_id":"e1cfb48f-52e5-4837-9dc8-f92408dfeaf9","resolution":{"observed_at":"2026-08-08T18:10:51.595035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.580650Z","title":", author Harte, N","venue":null,"work_id":"dac86e81-08df-4e7d-b297-b2f6c59f8752","year":2017},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.292804Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:36208897bb02e54742321d25ed7d144ad0cdd5690b194a3642849c7e498f02a5","observation_id":"53ca367f-defe-473e-9d99-c3690c48835b","resolution":{"observed_at":"2026-08-08T18:10:51.584750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.569827Z","title":", author Saam, C","venue":null,"work_id":"e6289901-1c4f-412f-a652-0a4e26728ee0","year":2020},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.295748Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:11c8dbd526364ba1f23d57a6a396f58d7aaea6c26fec9743a0f61ba3aee0fb37","observation_id":"d5c3a7f3-9e40-42f1-8f7c-cafd96837c92","resolution":{"observed_at":"2026-08-08T18:10:51.573813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.560182Z","title":", author Li, J","venue":null,"work_id":"58f420d9-82b1-45fe-a95a-a119910bd305","year":2016},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.300203Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:d5dbebfc3fbd43513c6276a4192a63a7391ae54911c3a2ad60be5d71279c28f9","observation_id":"d7b44fb7-12d4-45f1-8e97-bdd99cfaa49a","resolution":{"observed_at":"2026-08-08T18:10:51.563556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.549458Z","title":", year 2017","venue":null,"work_id":"a1769179-6768-4304-81c7-e030eb7f795d","year":2017},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.303728Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:03c9c52a6479360404d6dbd3dc00297031b34994e31c95d595a95dacaad4af7e","observation_id":"a1e5019b-b79b-4b83-a933-dea501009e87","resolution":{"observed_at":"2026-08-08T18:10:51.553935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.539394Z","title":", author Shazeer, N","venue":null,"work_id":"dd267f3d-c896-489b-b101-d280f8f68660","year":2017},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.307038Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:10354c2a68950997913a249419d49c69170d4d330fc15aa8fcdeddc427b4c08d","observation_id":"7ece74a4-bb20-49fd-b2a2-9f6d02f445f5","resolution":{"observed_at":"2026-08-08T18:10:51.542667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.529187Z","title":", author Ye, Z","venue":null,"work_id":"ad61b6a5-ad9e-4afd-9aed-fa9cfd49c785","year":2024},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.310984Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:2d10e7621248c084a8bc6998e216b83b29162ea4b897593ed082afeb750d8b74","observation_id":"2084a3f1-b896-426b-a8f1-19b0f72c7cfe","resolution":{"observed_at":"2026-08-08T18:10:51.532239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.518630Z","title":", author Koutn \\' k, J","venue":null,"work_id":"76d71d94-32d4-411a-81a6-d4cbce56bac0","year":2016},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.314365Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:27937ed1b3c4a52e64697af388fcb5ecce287f65489584e336cccf4368357e0c","observation_id":"96d5f433-9a5e-480d-8477-599f9f6dcb3e","resolution":{"observed_at":"2026-08-08T18:10:51.522759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.508834Z","title":", author Guo, P","venue":null,"work_id":"c3e79120-08cd-44ea-8d0d-323805ae176a","year":2024},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.317787Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:5f86209ef8117bdf3e5d1468b2e4940c5294878da1edfee7573193d16afe309d","observation_id":"e6848313-53bc-4b37-a23b-0d772da5ec8c","resolution":{"observed_at":"2026-08-08T18:10:51.512616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.498330Z","title":", author Guo, P","venue":null,"work_id":"47a92b1d-3fe6-49e9-95bd-f385149aa745","year":2024},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.321545Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:7d98d02d5021a64e2ec09bfa4878d6d6626e065a1b0fae66f4544e3893322baf","observation_id":"3deb2806-04f3-46d2-a702-8f55335838c0","resolution":{"observed_at":"2026-08-08T18:10:51.501924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.488057Z","title":", author Hori, T","venue":null,"work_id":"f65f89b4-a5a2-4d90-aefc-413cb405940a","year":2017},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.324891Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:f0ee8bbe7c9cfe071dd2694deb62a17172a1cbf38097980720211adf440228d7","observation_id":"07b99eae-1ba4-4f9e-856a-1b44dfe8e70c","resolution":{"observed_at":"2026-08-08T18:10:51.491975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.476479Z","title":", author Yang, Y","venue":null,"work_id":"1b4db85c-5b34-4b37-be21-fd33625b16ec","year":2020},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.328521Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:45fc0b200fdf4d29aef815fa0c4a88692b037ed1e922c991d59c2d8559f0de98","observation_id":"4991f4de-2598-4b76-916e-1dd15e7c8a62","resolution":{"observed_at":"2026-08-08T18:10:51.480434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.466303Z","title":", author Lu, C","venue":null,"work_id":"cc95f2f6-15e4-4f7e-a32b-b062c868fd9b","year":2020},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.331783Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:112efc70c07785052ecec445e8c5ac1ed63bc639142e48c8746b629873c110ec","observation_id":"187ad07d-1e0a-4f64-a80e-26ff9ae611e6","resolution":{"observed_at":"2026-08-08T18:10:51.469849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.457324Z","title":", author Li, D","venue":null,"work_id":"4cbb1a29-dc45-49c4-859c-24b13bab7781","year":2018},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.335140Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:e92dbe26a10b0b339cf578b4720787b965df7dc42223b17bbd85f92f83edfc00","observation_id":"2c69ddf2-fadd-4e94-825a-753261861fb9","resolution":{"observed_at":"2026-08-08T18:10:51.460662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.446582Z","title":", author Yao, K","venue":null,"work_id":"df5d5d3f-70bd-4678-833a-58870f10397a","year":2013},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.339090Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:e695714479d1e9100065601ee2c92d1115c3c8e1a51fa59a1a9375e2a62d7252","observation_id":"6fc76b49-a84b-4c47-baf8-d0d612e01760","resolution":{"observed_at":"2026-08-08T18:10:51.450753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.435084Z","title":", author Richmond, K","venue":null,"work_id":"1d813751-0362-4d7f-b353-b79e9ded94dc","year":2021},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.342860Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:a0688a6efc7f7785214ad5aed6d7cd30db8d041be8bdd10f195961d4f62787f6","observation_id":"12328439-cfc5-43ec-be79-d02fabf59ae5","resolution":{"observed_at":"2026-08-08T18:10:51.439009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.422365Z","title":", author Wan, G","venue":null,"work_id":"1915ef50-fefd-4de2-9cf8-dd4e462066ca","year":2023},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.346247Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:52c4577803cc16577c6393a4c2d1c7f4b40310ca54e96da1066c4e6d21164abc","observation_id":"934ba050-f697-413a-a8ef-61b7e80093ef","resolution":{"observed_at":"2026-08-08T18:10:51.426537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.410600Z","title":", author Wan, G","venue":null,"work_id":"bbaddd45-d14c-44e3-853c-8c86f235c6b6","year":2022},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.349741Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:6bdaf2ce90303adb34e1c95a80ef8cfe07e79a5de608d411761c610ae9ab8b4e","observation_id":"157c9fcf-c2f7-483a-8b5a-0883cdf938fb","resolution":{"observed_at":"2026-08-08T18:10:51.414899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.399771Z","title":", author Yang, S","venue":null,"work_id":"f105faa6-9452-49e6-8b3b-2cd2c0c9a3b6","year":2020},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.354082Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:ff36c3169f9ff2437a356ac3d1f6daba05f9e569bfc2a95ae80df91032987655","observation_id":"f499a3b9-eb23-4ecb-a74c-ed5458c70228","resolution":{"observed_at":"2026-08-08T18:10:51.403996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:10:51.387710Z","title":", author Zhou, L","venue":null,"work_id":"70413768-a700-4dca-8e5e-9273d08fc190","year":2024},"citing_paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T18:10:51.357615Z"},"links":{"citing_paper":"/paper/2502.05758"},"observation_digest":"sha256:0c6f3a546f249f3708ff60316d3d73252fb559142fe8ca9f6320adfd2a6d79b0","observation_id":"c0a96dd5-0d30-4631-822e-ff9df668642c","resolution":{"observed_at":"2026-08-08T18:10:51.393107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.05758","last_updated":"2025-02-09T03:37:01Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-11T14:11:17.988660Z","submitted_at":"2025-02-09T03:37:01Z","title":"Target Speaker Lipreading by Audio-Visual Self-Distillation Pretraining and Speaker Adaptation"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":62},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2502.05758."}