{"as_of":"2026-08-08T03:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:51f1b363a5b32ca3976bebb31f1ea1938992b2516e30b79e0c2ca317662cd5f1","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:27:40.454155Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:27:36.490653Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:27:40.969156Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"cited_work":{"arxiv_id":"2506.02010","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02010","snapshot_observed_at":"2026-08-07T13:27:40.969156Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","venue":"cs.CV","work_id":"2b032588-a961-4729-b518-38baaf663deb","year":2025},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:36.490653Z"},"links":{"cited_paper":"/paper/2506.02010","citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:c949305c880766bf2c9fb5b654367b17e786b88f4e8d5bf44511f83111982a48","observation_id":"a3b042f7-8900-48d6-83c4-5fc5ae016983","resolution":{"observed_at":"2026-08-07T13:27:41.073670Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02010/citation-record","integrity":"/paper/2506.02010/integrity","json":"/paper/2506.02010/citation-record.json","paper":"/paper/2506.02010"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:44.089495Z","title":"It has a wide range of applications, including public surveillance, assistive technologies for the elderly and disabled, and deepfake detection [1, 2, 3, 4]","venue":null,"work_id":"ae3bf31d-35a3-410e-a1d6-c4d655296d49","year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:36.413924Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:90bad52740800be76176b71196b92d9145b67aad95cc4adfc0b830500d82e6d0","observation_id":"fda6371e-075d-4fb3-adb7-9d3ea01c725a","resolution":{"observed_at":"2026-08-07T13:27:44.147053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"cited_work":{"arxiv_id":"2506.02010","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02010","snapshot_observed_at":"2026-08-07T13:27:40.969156Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","venue":"cs.CV","work_id":"2b032588-a961-4729-b518-38baaf663deb","year":2025},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:36.490653Z"},"links":{"cited_paper":"/paper/2506.02010","citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:c949305c880766bf2c9fb5b654367b17e786b88f4e8d5bf44511f83111982a48","observation_id":"a3b042f7-8900-48d6-83c4-5fc5ae016983","resolution":{"observed_at":"2026-08-07T13:27:41.073670Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.994505Z","title":"Only the datasets provided by the organizer (except CN-CVS2-P1) were used, meaning these systems conform to the specifications of the fixed tracks","venue":null,"work_id":"c630e204-af1d-4f66-bee2-7b422a801d4e","year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:36.632246Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:56ac3da297b98039e580bab180749ab6f2d9009121e22dcfaf74758c433c9fa8","observation_id":"f843ad0b-c733-4bc6-862c-60d3b9f46bb7","resolution":{"observed_at":"2026-08-07T13:27:44.024046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.859246Z","title":"Leaderboard CNVSRC 2024 received 10 valid submissions from 4 partic- ipating teams","venue":null,"work_id":"070929b7-e298-4b4a-9f67-edb466bc0360","year":2024},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:36.773554Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:3cbacffeb4bf433b084913135ed12cda8dc927003571ebecc73ef337e8b5e1eb","observation_id":"30707a7b-0fd7-42d9-af6c-74858ab97264","resolution":{"observed_at":"2026-08-07T13:27:43.903289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.747022Z","title":"Compared to CNVSRC 2023, this year’s challenge introduced a stronger baseline system and more train- ing data, further pushing the boundary of the Chinese VSR re- search","venue":null,"work_id":"8ee44cd2-f005-4f87-a41c-c4aa93ad2d0c","year":2024},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:36.944767Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:46b569a9e939d5892407128edb0fbb2e1b17aed11fa76bd963986cab2701dac8","observation_id":"5fb3bf5f-ddad-4d51-9338-a0433d5cd07f","resolution":{"observed_at":"2026-08-07T13:27:43.792158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.664688Z","title":"Continuous automatic speech recognition by lipreading,","venue":null,"work_id":"0ab8528e-bc35-4d8d-a413-06ce4384efbe","year":1997},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:37.128609Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:45d93e69805a07c948495fea161c5428f230385a74a8705ee03b92c119a25df9","observation_id":"c5017300-b00c-4e2c-99a6-dd278052e56c","resolution":{"observed_at":"2026-08-07T13:27:43.695099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.548425Z","title":"Audiovisual in- tegration and lipreading abilities of older adults with normal and impaired hearing,","venue":null,"work_id":"340d6295-afea-4684-bce1-d7f70f430b13","year":2007},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:37.223945Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:ca6b5b39cf53823308915f03ec0bc3761667cdc6be21f9a0384bd845067218f6","observation_id":"f9cf8b01-8b5d-4b2d-83f9-2c98d77e67a1","resolution":{"observed_at":"2026-08-07T13:27:43.595194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.412382Z","title":"Visual speech recognition,","venue":null,"work_id":"e58280a8-d322-4e43-955e-5a9238e99cc4","year":2011},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:37.357567Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:b3176a734996b398c8dd692f80e4d19df4b03d25a54b47d14196811b5ce40307","observation_id":"5a6aaf80-45cb-4f37-8e1c-42f4e45acbf3","resolution":{"observed_at":"2026-08-07T13:27:43.475169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.305436Z","title":"Lips don’t lie: A generalisable and robust approach to face forgery de- tection,","venue":null,"work_id":"28651f6f-0207-4412-b097-0f2642cd2129","year":2021},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:37.668986Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:df3a2c72a7939a47635de1536b23adf6bc03773f634c5deee12888a8b6d025bc","observation_id":"66e2d2ab-a4cc-4201-808e-59ec2e8064c0","resolution":{"observed_at":"2026-08-07T13:27:43.343003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.193681Z","title":"Multi-temporal lip-audio mem- ory for visual speech recognition,","venue":null,"work_id":"d0231455-3ca8-4987-a9a5-332622e3aeae","year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:37.779002Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:aa71729961476e967ed3d1aa9d9c9d5886eb39c38cb254708a7518ee839ac425","observation_id":"0771309a-cb55-46b1-b735-c0998c3b75da","resolution":{"observed_at":"2026-08-07T13:27:43.256867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:43.079849Z","title":"Training strategies for improved lip-reading,","venue":null,"work_id":"8f24a4e0-163d-4d7e-829f-f21f40234ce9","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:37.980122Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:04e31967bd98b962d20256de8ab13da872971b2490a198a4d82b84570e037601","observation_id":"eb247147-f0c0-40af-809b-7177c2c2a238","resolution":{"observed_at":"2026-08-07T13:27:43.132493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.966010Z","title":"Improved word-level lipreading with temporal shrinkage net- work and netvlad,","venue":null,"work_id":"44c4e92a-5f99-4e3c-9aa2-e239ad69b183","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.084984Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:f1aec78ecd46ad51133d36b016fe29675b4149f7511ad1ac58d94db69a6a7731","observation_id":"3a57cf48-7c06-4bc4-befc-6542638ad6eb","resolution":{"observed_at":"2026-08-07T13:27:42.998784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.819620Z","title":"Lip reading in the wild,","venue":null,"work_id":"819a2007-4a99-4e01-97fe-d2ebd234cc07","year":2016},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.154993Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:051af61cf1c80ce7bf66c8349ca7011632baa831d37b58df0d43be17a292bcb9","observation_id":"4b513915-71d9-4851-a7f9-1fe39af6d2bc","resolution":{"observed_at":"2026-08-07T13:27:42.890849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.648193Z","title":"Distinguishing homophenes using multi-head visual-audio memory for lip reading,","venue":null,"work_id":"efaa5cd0-b078-4471-9119-df1777bdd546","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.279161Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:d51e640bda65a55f0e56cac39a1a724e7d7253b09b172970d94766f150475958","observation_id":"e229cbb6-0806-4b61-8cc1-2d1ab0bb774d","resolution":{"observed_at":"2026-08-07T13:27:42.722388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.565406Z","title":"Con- former is all you need for visual speech recognition,","venue":null,"work_id":"d7e74cad-c77a-4d76-9e35-c00cc58344b1","year":2024},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.442327Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:9fb6033f4299a943bdcaaf66995fbfd53452d214b6adaa300107990d1337eb5f","observation_id":"985977bb-f6b5-4ce5-b964-7ebfee1af6e3","resolution":{"observed_at":"2026-08-07T13:27:42.589227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.429146Z","title":"Transformer-based video front-ends for audio-visual speech recognition for single and multi-person video,","venue":null,"work_id":"b9796218-2532-4e9a-aa74-603f445b0b64","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.568923Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:d7d98094ad552c36a68f706fe626f165b33aba63910bb282cd8fa5a21d89481f","observation_id":"e420793d-60d1-4414-aae1-661a39e7a4bb","resolution":{"observed_at":"2026-08-07T13:27:42.498752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.296298Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":"29613000-9464-4593-8323-a99989599406","year":null},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.652240Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:6133e28bbedc6942f1ab90fe91bcf13e63b10a04cf3fe9c9a5efd9d788a74d6f","observation_id":"94c24405-4f8b-42b2-817b-60d0e28d3fa6","resolution":{"observed_at":"2026-08-07T13:27:42.332358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:42.181521Z","title":"Large- scale visual speech recognition,","venue":null,"work_id":"e990421f-bb05-4928-8cce-2d5ef93b49bd","year":2019},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.746781Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:9fe101c80845fda5a555bc5374d0c06a41e27784381df73aa9923eff334d9ac2","observation_id":"6848ec7b-2331-461b-977e-dc6118a1b3ab","resolution":{"observed_at":"2026-08-07T13:27:42.232738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:38.926626Z","title":"CN-CVS: A Mandarin audio-visual dataset for large vocabulary continuous visual to speech synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:38.926626Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:77f7bb89f3c3eea10de98ab04d17e4b596058228a7992d0096fb5dcbe4f782e3","observation_id":"5b476e5a-bca0-4c11-a926-9c355cce20c5","resolution":{"observed_at":"2026-08-07T13:27:38.926626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:39.067394Z","title":"CNVSRC 2023: The first Chinese continuous visual speech recognition challenge,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.067394Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:45f2b0004a191952c4c787e60b1fcc25718601feb26bc1db8019b3c0a7229688","observation_id":"c96b4a5f-65aa-4a04-a5a3-3b378c422c58","resolution":{"observed_at":"2026-08-07T13:27:39.067394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:39.196049Z","title":"Auto-A VSR: Audio-visual speech recognition with automatic labels,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.196049Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:60cbeb91e61e18740becc314e490f39ddc09a8f65c5ebf1ed390f70a0d2706ea","observation_id":"441450db-b638-4ff9-9ccf-aef6ab8b39b3","resolution":{"observed_at":"2026-08-07T13:27:39.196049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.974008Z","title":"Combining residual net- works with LSTMs for lipreading,","venue":null,"work_id":"3660066e-fd48-4440-9c01-d3052cb7cdea","year":2017},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.306895Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:b5f7b06f48fcdfc3e76c485eac1560f8410ab2d8058cfc51791abc0710efd7cd","observation_id":"9c7dae19-31c9-48ca-a07d-0498567da775","resolution":{"observed_at":"2026-08-07T13:27:42.007264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.866461Z","title":"Conformer: Convolution- augmented Transformer for speech recognition,","venue":null,"work_id":"79c78e3f-6a47-4518-ae62-47b6967bcbda","year":2020},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.459580Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:28a177822a32f6c7aa31892c4ea959a6593939c10ada2c01b3f00c48db3e3fca","observation_id":"0e823916-b9a7-484e-a6eb-b64bff230d3a","resolution":{"observed_at":"2026-08-07T13:27:41.933622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05642","last_updated":"2021-12-30T00:30:30Z","snapshot_observed_at":"2026-08-04T06:59:25.324887Z","submitted_at":"2021-06-10T10:25:15Z","title":"U2++: Unified Two-pass Bidirectional End-to-end Model for Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05642","snapshot_observed_at":"2026-08-07T13:27:39.557934Z","title":"U2++: Unified two-pass bidirectional end-to-end model for speech recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.557934Z"},"links":{"cited_paper":"/paper/2106.05642","citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:40538d9e04a85f30fa8343b4b9c721e02c94f65c34a34b4823798171b89a8ee5","observation_id":"bca2496f-9d7d-4ddf-a2db-5482e500e49c","resolution":{"observed_at":"2026-08-07T13:27:39.557934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.696060Z","title":"Hybrid CTC/attention architecture for end-to-end speech recog- nition,","venue":null,"work_id":"23db29d5-49a0-415a-942d-b46d01e35966","year":2017},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.605038Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:95901698f13e2767a7447d1338265334c234a6d6c5f6c8ccfacab5039d840acb","observation_id":"ef902514-bf8b-4420-a6dd-a04e86ea551b","resolution":{"observed_at":"2026-08-07T13:27:41.756204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:39.713009Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.713009Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:64a2cae02e71bc7726bd4a73c603dd0ea3f6af1b4b8da86f65037e70d9e213d1","observation_id":"0f4f77f8-5a28-4924-87eb-2008d50784f4","resolution":{"observed_at":"2026-08-07T13:27:39.713009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06788","last_updated":"2024-02-29T18:09:40Z","snapshot_observed_at":"2026-07-06T17:14:57.853205Z","submitted_at":"2024-01-07T14:20:52Z","title":"The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023","version":2},"cited_work":{"arxiv_id":"2401.06788","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.06788","snapshot_observed_at":"2026-08-07T13:27:40.803705Z","title":"The NPU-ASLP-LiAuto System Description for Visual Speech Recognition in CNVSRC 2023","venue":"eess.AS","work_id":"d47b4b75-e4dc-42a8-83a9-5ff50e84cf97","year":2024},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.818617Z"},"links":{"cited_paper":"/paper/2401.06788","citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:952ae5207adc5d79a5b2141c220769d648f2152563c3ed7cc0c7fb18793dc97e","observation_id":"a5bf7075-b950-486b-80cf-522ce7a6d128","resolution":{"observed_at":"2026-08-07T13:27:40.861015Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05466","last_updated":"2024-04-30T15:51:21Z","snapshot_observed_at":"2026-08-01T00:56:53.649383Z","submitted_at":"2024-04-08T12:44:24Z","title":"Enhancing Lip Reading with Multi-Scale Video and Multi-Encoder","version":2},"cited_work":{"arxiv_id":"2404.05466","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.05466","snapshot_observed_at":"2026-08-07T13:27:40.588688Z","title":"Enhancing Lip Reading with Multi-Scale Video and Multi-Encoder","venue":"cs.CV","work_id":"960ff852-e945-4655-ad64-154efc8e34bb","year":2024},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:39.946392Z"},"links":{"cited_paper":"/paper/2404.05466","citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:1c97c30182a978d4363f06f179bc035b9f0790294aaf4cf868136777b595a053","observation_id":"6cc3c219-c584-4851-8351-61266178b0ae","resolution":{"observed_at":"2026-08-07T13:27:40.664659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.587179Z","title":"MFA-Conformer: Multi-scale feature aggregation con- former for automatic speaker verification,","venue":null,"work_id":"cd4c4cd5-e00b-4c20-b9f2-4d01f557e830","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:40.033514Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:687a62f6e538aeaf2b249886f50a6786e9a15faf458d0b9eb33a0d6159b8e5a9","observation_id":"d31570dc-6315-4b16-acd0-3d3ada9e8347","resolution":{"observed_at":"2026-08-07T13:27:41.634481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.463720Z","title":"E-branchformer: Branchformer with enhanced merging for speech recognition,","venue":null,"work_id":"52a2a987-f47b-4541-b537-939cf756b5fc","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:40.116643Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:ec7e7b265094da4e2617a63f7c62f396e2c8dec03d2bc4ac5d0c659fb3845a7a","observation_id":"fa9fc0d0-9019-4c28-a595-97d2619e49b4","resolution":{"observed_at":"2026-08-07T13:27:41.517395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.295831Z","title":"On the parameteriza- tion and initialization of diagonal state space models,","venue":null,"work_id":"f8051830-95c7-4038-8db9-b95783f50167","year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:40.195906Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:595a44042dede9c48a3c37e96f171e70243495a7e26c65ca0d8d60b9075d13cf","observation_id":"c46b5728-56da-48b4-8703-1a5bd6c84083","resolution":{"observed_at":"2026-08-07T13:27:41.369324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:40.303807Z","title":"Efficiently modeling long sequences with structured state spaces,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:40.303807Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:1084f9263811747de7a3c81ac3b8ef41cfe0355bbeb8771848c126ccc162a685","observation_id":"36c4d22b-d6a3-493b-bc27-872796eede46","resolution":{"observed_at":"2026-08-07T13:27:40.303807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:41.161737Z","title":"Structured state space decoder for speech recognition and synthesis,","venue":null,"work_id":"f028a8a9-c758-4c48-a427-b948720dc9af","year":2023},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:40.378661Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:2d86f2dbfb7790301fabcf88bf45a8d94729459e29f287dd6a0e2cef6b9c3e83","observation_id":"d61e479e-4ab6-4efc-9321-ba1431695fe7","resolution":{"observed_at":"2026-08-07T13:27:41.219409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:27:40.454155Z","title":"A post-processing system to yield reduced word er- ror rates: Recognizer output voting error reduction (rover),","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:27:40.454155Z"},"links":{"citing_paper":"/paper/2506.02010"},"observation_digest":"sha256:28daa6b82975ac25ae7bac39e0ff581c232fded688091a5a910cb9e9adac23d1","observation_id":"7ab920f7-31a7-4d42-b745-6fa6e13e518a","resolution":{"observed_at":"2026-08-07T13:27:40.454155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02010","last_updated":"2025-05-27T20:25:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:21:55.078099Z","submitted_at":"2025-05-27T20:25:31Z","title":"CNVSRC 2024: The Second Chinese Continuous Visual Speech Recognition Challenge"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":24},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2506.02010."}