{"as_of":"2026-08-08T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:251d413ca418b73bb0c3ef22427678c91d6e45c833f121bb940b990f8b2e9e3e","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:33:52.053922Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02178/citation-record","integrity":"/paper/2506.02178/integrity","json":"/paper/2506.02178/citation-record.json","paper":"/paper/2506.02178"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:59.962555Z","title":null,"venue":null,"work_id":"c1217053-1bcc-4ada-a79f-3ea459c77ca3","year":1976},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:46.680231Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:8be3f8c1537377bc424b21242cadd4b2406afc2659da7eb1d5613507ca30f895","observation_id":"69629e47-2e64-441f-9e27-0d3ef9f2be0e","resolution":{"observed_at":"2026-08-07T11:34:00.070508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:59.660702Z","title":"Task definition Given an input sequence of audio A = {a1, a2,","venue":null,"work_id":"7cc022d4-f4d3-45d0-8d1c-a200db22cbd9","year":null},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:46.797891Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:5060c81dbb1c0f7d49c8f57e95b85bdbfef3b45f52247218e9f78e99f0d67ca8","observation_id":"09abe8b3-a228-4a21-9d8a-51e66e20fe00","resolution":{"observed_at":"2026-08-07T11:33:59.796475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:59.192010Z","title":"For training, we use LRS2 (train and pretrain sets), V ox2 (train set), and A VYT","venue":null,"work_id":"2b046130-240f-4d56-bda6-b092d0a74b10","year":null},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:47.064621Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:d127f614980c0f7759e7c3062d0a0e3dae1fe509b3f6241fbcd65bcdbb57d666","observation_id":"89a15ed6-0bee-4b18-b1f9-1b79cf888d84","resolution":{"observed_at":"2026-08-07T11:33:59.322712Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:58.969566Z","title":"The A V-HuBERT CTC/Attention (A V1) model uses the A V-HuBERT large [12] as the encoder, which has 24 transformer blocks, each with 16 attention heads","venue":null,"work_id":"fabad18a-5809-4ef0-857c-f1879e4cb54b","year":null},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:47.194615Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:7f7b941104b509dc725132b24da485f7748ffaabc9002fd22788ead30e0fc3ba","observation_id":"d388c060-6fb0-47e8-a097-b47628032925","resolution":{"observed_at":"2026-08-07T11:33:59.076103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:58.658682Z","title":"The WERs for models evaluated on the original LRS2 test set are shown in the column where SNR = ∞","venue":null,"work_id":"9ee193d0-cde1-4e5c-b461-b9f634f9dd72","year":null},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:47.330476Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:437a5846f024287583de0fc97671e98a369242efc513e23770cc95304f723aed","observation_id":"544ba7dc-756e-42e9-b7c2-76383fb4e87e","resolution":{"observed_at":"2026-08-07T11:33:58.810431Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:58.441338Z","title":"We highlighted the gap between conventional datasets and real-world cocktail- party scenarios, where target speakers are not always ac- tive","venue":null,"work_id":"1b9779ea-19df-4652-8534-ae1a050b191b","year":null},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:47.459176Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:8cb6f74b77946fdc18a4ebbe003d18466354c6d813691c9891edcdc5ee44c6cf","observation_id":"0b47fdb0-1712-40ff-9aec-a3e62004d8d3","resolution":{"observed_at":"2026-08-07T11:33:58.566966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:58.167776Z","title":"How is AI Changing Science? Research in the Era of Learning Algorithms","venue":null,"work_id":"bd60acda-fd70-4d20-9b08-f57912db7234","year":null},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:47.577534Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:1cb24c1b710b91eaadef9097445c75781bb3f4930170f3519f213cf4836b8f5f","observation_id":"8aa6569e-f973-45b0-9770-ef4ae4cfc25b","resolution":{"observed_at":"2026-08-07T11:33:58.280233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:57.098826Z","title":"Knowing who to listen to in speech recognition: Visually guided beamforming,","venue":null,"work_id":"4a1eea40-800b-43c3-bf8f-c972eff13d12","year":1995},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:48.648069Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:da288d3832164740bc0d49bb96bc5a972ff5a23b302abb2b56000010e652f81d","observation_id":"000f8e70-32b7-4932-bca3-bdb3b8fcf14e","resolution":{"observed_at":"2026-08-07T11:33:57.228249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:47.738240Z","title":"Hearing lips and seeing voices,","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:47.738240Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:c645841cfdf9dd9baf99884b69e1aeaca1ce81fabe8838a3ef538f5767eff182","observation_id":"49f73fe2-8684-49d0-a265-347a8aa056a7","resolution":{"observed_at":"2026-08-07T11:33:47.738240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:47.925263Z","title":"Muavic: A multilingual audio-visual corpus for robust speech recognition and robust speech-to-text translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:47.925263Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:e1de58539f440e2403cdef0ab4ad5989977b5593487c2edc32031b3c8d248c06","observation_id":"0e0c50f4-0308-40d5-8c9d-1ad72f60d392","resolution":{"observed_at":"2026-08-07T11:33:47.925263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03449","last_updated":"2021-07-26T20:56:49Z","snapshot_observed_at":"2026-08-08T05:07:28.415753Z","submitted_at":"2020-10-07T14:41:32Z","title":"Super-Human Performance in Online Low-latency Recognition of Conversational Speech","version":5},"cited_work":{"arxiv_id":"2010.03449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.03449","snapshot_observed_at":"2026-08-07T11:33:52.324326Z","title":"Super-Human Performance in Online Low-latency Recognition of Conversational Speech","venue":"cs.CV","work_id":"a49eaa6a-d921-4cfe-9368-7b6a4800bf94","year":2020},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:48.048385Z"},"links":{"cited_paper":"/paper/2010.03449","citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:bb698de43dd3cc293342462a47ceba8c4ec692dc665bd66016ad4cfdb11db009","observation_id":"571c6281-057d-4e5e-a4bb-7ac627c59fdc","resolution":{"observed_at":"2026-08-07T11:33:52.430647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:59.400089Z","title":null,"venue":null,"work_id":"f61a4071-1ee5-48d2-b4ab-0db052dbd627","year":null},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:46.922739Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:b17e14e51667af00adb37cff97ad9166cae0e46ae2e9e020c4a42d6306b67159","observation_id":"66de8a82-0444-497e-80e7-a82766e5d749","resolution":{"observed_at":"2026-08-07T11:33:59.539666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:57.901676Z","title":"Recognition of conversational telephone speech using the janus speech engine,","venue":null,"work_id":"5e3312cd-88ee-4423-8fe9-0c91ba3367b5","year":1997},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:48.166647Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:3ab2c59408f2014934c02c08d9ff1a8a36713491798dc7dc009f105360dbf11a","observation_id":"e4af78f2-617d-404a-ab3a-0487f7473dba","resolution":{"observed_at":"2026-08-07T11:33:58.018024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:48.303473Z","title":"See me, hear me: inte- grating automatic speech recognition and lip-reading,","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:48.303473Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:c16a9743b8a596b73f3934ceeeeee661006b705f4159547cd6a717f146d30fb2","observation_id":"d0750410-d6e9-4e47-84c5-4340803780ca","resolution":{"observed_at":"2026-08-07T11:33:48.303473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:57.625242Z","title":"Multimodal interfaces,","venue":null,"work_id":"e23794be-58eb-48df-ace2-b6e63d14e37a","year":1996},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:48.418256Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:5e6558f7abee472a8856dbfada7504d1c4a96bd2e9b5a1a04faab0ded2111b58","observation_id":"4d39485d-cc8e-4944-80d8-c594e9dc7e1c","resolution":{"observed_at":"2026-08-07T11:33:57.723392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:57.367277Z","title":"Modeling focus of at- tention for meeting indexing,","venue":null,"work_id":"69e5eccd-67b3-476e-886e-d80ccd8cc83a","year":1999},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:48.541362Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:563a54915f87a5b79aae116e4b5f4e129b7e263070a6edb50190c35b3ab1fe9a","observation_id":"a64442cf-b5ec-473d-8a67-87295b2d83c8","resolution":{"observed_at":"2026-08-07T11:33:57.500393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:56.850280Z","title":"Visual track- ing for multimodal human computer interaction,","venue":null,"work_id":"830f7f3d-3d45-4d6c-8b6b-80d5f2537cd2","year":1998},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:48.752559Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:f16938e1a670c40cf68969cbba81665d2a935b14700e340c1d6f4e898ed199eb","observation_id":"895b5d0d-c927-4c2e-9035-fa9af05703ee","resolution":{"observed_at":"2026-08-07T11:33:56.972059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:56.602567Z","title":"Estimating focus of attention based on gaze and sound,","venue":null,"work_id":"136523c0-4d53-4713-a626-8cd98f067986","year":2001},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:48.882045Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:57b6fa8cecd1dedbbaa8a2281309d6bd62167e18b0a270bee88141949c6a9223","observation_id":"2fb81885-5478-49af-a611-a35f13ec12ad","resolution":{"observed_at":"2026-08-07T11:33:56.728640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:56.291973Z","title":"Chil: Computers in the human interaction loop,","venue":null,"work_id":"d2ab7d8b-135a-42d1-8f11-2bb0db7dcd4d","year":2005},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:49.010398Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:a7f5cd3507dbc4e20d6596374ace53774dd1051129eb33ae63723f103b2dda2c","observation_id":"449b42b3-e185-4d2f-8aa5-487dbb195c09","resolution":{"observed_at":"2026-08-07T11:33:56.459235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:55.985652Z","title":"Robust self-supervised audio-visual speech recognition,","venue":null,"work_id":"1b4a10d8-d9b4-4032-9eb7-0c03afc2933d","year":2022},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:49.140475Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:9b3060fa161ddf35554d0f75b33efe0fc115a021df6e6fc54e406ac631d908d5","observation_id":"2d352c00-65e7-45db-9210-f041cb23e2c1","resolution":{"observed_at":"2026-08-07T11:33:56.121810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:55.752611Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels,","venue":null,"work_id":"70c76757-5ead-44e8-9b11-be17d5a6887d","year":2023},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:49.233772Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:59b11ffa29843d44c9b85edc743e2395b6fea77b22ed6f601ebc1426ed561082","observation_id":"417a4001-a7f1-4c34-bba2-e274b8007a83","resolution":{"observed_at":"2026-08-07T11:33:55.873050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:49.361747Z","title":"Whisper-flamingo: Integrating visual fea- tures into whisper for audio-visual speech recognition and trans- lation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:49.361747Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:2ea3219684659ff770cdb2e6441bbae5363cf84b9b0238c89419313fd6b4768d","observation_id":"c68e33f3-e420-4d17-8582-18862c7170c1","resolution":{"observed_at":"2026-08-07T11:33:49.361747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:55.479553Z","title":"Speaker-targeted audio-visual models for speech recognition in cocktail-party environments,","venue":null,"work_id":"c5dd897f-b46c-47cf-8a65-09db3835ea54","year":2016},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:49.466179Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:8e18d13c060d25bbff03255da5a3dd91474eddae1284975d2c7d2a19f5a62263","observation_id":"ce23936d-fff7-4fcc-8e82-78f2229ee0c5","resolution":{"observed_at":"2026-08-07T11:33:55.584216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:55.205644Z","title":"Audio-visual multi-talker speech recognition in a cocktail party,","venue":null,"work_id":"7ba8d374-6e72-4eab-ae0c-4ed988a50df9","year":2021},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:49.588319Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:d4867eefea137637512c135dcf6db6e534c8de15b018e7b931742590b2559a5f","observation_id":"616c2b1a-4dc2-409b-b6f2-cbab93fdb9a8","resolution":{"observed_at":"2026-08-07T11:33:55.337694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:54.944546Z","title":"Robust audio-visual asr with unified cross-modal attention,","venue":null,"work_id":"2460fc87-6361-45ec-ab2d-fb0c700816b9","year":2023},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:49.736454Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:2ab7a36614758d99052046f332254321fc1fb6acd3d12d90f1f01d66bf4132ff","observation_id":"5412a3ce-84d3-4df4-9229-aed1624a57c4","resolution":{"observed_at":"2026-08-07T11:33:55.055313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:49.876226Z","title":"Looking to listen at the cocktail party: a speaker-independent audio-visual model for speech separation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:49.876226Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:14311241428a8484f934fa16517f282edf3b5ae9804941ee6def629e8b29fdcf","observation_id":"a4257471-b8c4-48c8-98e7-4c55494e0247","resolution":{"observed_at":"2026-08-07T11:33:49.876226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:54.641376Z","title":"Visualvoice: Audio-visual speech sep- aration with cross-modal consistency,","venue":null,"work_id":"e2ae255a-b761-45a8-a463-1ab7f21b59a2","year":2021},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:50.019620Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:d2c77ab2fe8dca745872b16043fc33d08375cea76d61b2eff7de0a2dff03bc44","observation_id":"86c0b254-0e57-4c40-aea5-d2534ecd2d31","resolution":{"observed_at":"2026-08-07T11:33:54.796426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:54.386068Z","title":"Seeing through the conversation: Audio-visual speech separation based on diffu- sion model,","venue":null,"work_id":"15cecdd2-e794-4598-90a4-f83ab13727ad","year":2024},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:50.095686Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:5911469462757279ef5296b0fe20186d75f57cd6aceb55b218ef96adf6562e93","observation_id":"a96f7f83-0fed-4d3a-b55b-31f2ebeec776","resolution":{"observed_at":"2026-08-07T11:33:54.504909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:50.237457Z","title":"Lip read- ing sentences in the wild,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:50.237457Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:44695475464a469f1baa2a0b09427d6f1e5138ad1ca2453e38ab2a5ead458173","observation_id":"16f1a9e5-2c18-4ed6-9d0c-d6b801f490dc","resolution":{"observed_at":"2026-08-07T11:33:50.237457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-07T11:33:50.389831Z","title":"Lrs3-ted: a large-scale dataset for visual speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:50.389831Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:30e30838f49fc13797d0e6fb2d93f79885cb0bd53bf101a84817f8c16515168d","observation_id":"b7ad5a0f-a6ca-467e-b941-c5f4ef9d3d18","resolution":{"observed_at":"2026-08-07T11:33:50.389831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:50.516594Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:50.516594Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:a87f2118fafba3bbdcbce324412cb63875d1bd2bd4ee201f5c91d88376b73b06","observation_id":"754f3861-d6af-4fd6-a7d5-268aafc9688d","resolution":{"observed_at":"2026-08-07T11:33:50.516594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:54.103767Z","title":"Unified cross-modal at- tention: Robust audio-visual speech recognition and beyond,","venue":null,"work_id":"12a0cd40-7a27-4595-8baf-f875a7caf2ba","year":1941},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:50.613225Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:ff18916eb210c15847cd5a053a9c4c68eff16bd70c1179ba5b62af6678f25bed","observation_id":"d149db78-4009-4645-a845-b1eaa41a963e","resolution":{"observed_at":"2026-08-07T11:33:54.253078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:53.862736Z","title":"The first multimodal information based speech processing (misp) challenge: Data, tasks, baselines and results,","venue":null,"work_id":"973c3894-11da-463b-882b-23f739d8a503","year":2022},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:50.729030Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:7fd642d74543b3b392e9c189f46ed76fb8033719fb8d5ea0648c87401b294b6a","observation_id":"5671cdd1-37fa-430c-bbd5-13b737cd4ac9","resolution":{"observed_at":"2026-08-07T11:33:53.977114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:53.570879Z","title":"Summary on the multimodal information based speech processing (misp) 2022 challenge,","venue":null,"work_id":"b3c51718-9c46-444c-a04c-3c6981eb3aa4","year":2022},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:50.893618Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:083878afdae8ad1b9814da5ac223c1dc9ec6ac11f77b9e6993760af550982570","observation_id":"85d7a2be-fdbc-4a69-964e-a9c1d392050d","resolution":{"observed_at":"2026-08-07T11:33:53.723238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:53.309067Z","title":"Summary on the multimodal information- based speech processing (misp) 2023 challenge,","venue":null,"work_id":"951aad56-f136-4bcc-a1db-0a7a1ecb3a95","year":2023},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:51.016640Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:134592988a9480062b140a76c8c2232197e7698432f7ee17645c089af02b37b2","observation_id":"3b46bbb2-dd24-4a08-b344-7fac75f5ebd8","resolution":{"observed_at":"2026-08-07T11:33:53.446222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T11:33:51.141038Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:51.141038Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:184ecfd7bfdc24df27043b03932a1e46125b2261881cd39efdada1afb470aedf","observation_id":"a5122e6c-0b43-417c-9412-5550698e7071","resolution":{"observed_at":"2026-08-07T11:33:51.141038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:51.258214Z","title":"Hy- brid ctc/attention architecture for end-to-end speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:51.258214Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:c2387b34cafef42d6b7a868ba5543531aa47a71bde9936d3cca3c6f1d94bea6d","observation_id":"044d076e-366b-4787-98de-26b2f36dca3a","resolution":{"observed_at":"2026-08-07T11:33:51.258214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:53.066494Z","title":"End-to-end audio-visual speech recognition with conformers,","venue":null,"work_id":"a8628014-790f-4aea-bd59-df037d61e747","year":2021},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:51.412311Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:2579b644a79f32e607103769b67814e4236106bf41af82605992f75407e4dad4","observation_id":"4f5a526e-c436-4455-a64f-17f06af5a54a","resolution":{"observed_at":"2026-08-07T11:33:53.196111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:52.794429Z","title":"From text segmentation to smart chaptering: A novel benchmark for structuring video transcriptions,","venue":null,"work_id":"467ff588-4e92-4320-9e2d-5f44d3e6ca0a","year":2024},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:51.563545Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:fae34d5b690b7ee45b470d4dda72a2a696dcb0343cb5010d44f150e3f2c14458","observation_id":"2e3ed08e-49da-42ae-bd49-95707080c23d","resolution":{"observed_at":"2026-08-07T11:33:52.906716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:51.689641Z","title":"A light weight model for active speaker detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:51.689641Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:be20a35f179296615c956f4e933b24f2f565bccf36697a64d0ad048bc202edd6","observation_id":"b61790ee-525c-413c-be7c-5c2b623b9c80","resolution":{"observed_at":"2026-08-07T11:33:51.689641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:51.824718Z","title":"Out of time: Automated lip sync in the wild,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:51.824718Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:81d8f298e53eeb4468b853d7449bc3fef02b413c43b7bfc760f7b6ed61933a16","observation_id":"e55c6a2c-03d5-4e7e-86af-cc3423175638","resolution":{"observed_at":"2026-08-07T11:33:51.824718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:51.949505Z","title":"Synthetic conversations improve multi-talker asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:51.949505Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:1fec2fd792874e6757dcdd9cd8801e5c9731a5daa3c5dca8dfa38f77ebb3040e","observation_id":"ad33d507-50b3-411d-8a83-3b4fc66134b2","resolution":{"observed_at":"2026-08-07T11:33:51.949505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:52.552075Z","title":"Msa-asr: Efficient multilingual speaker attribution with frozen asr models,","venue":null,"work_id":"d29484ab-29d7-46a4-ad33-3aa241501a4c","year":2025},"citing_paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:52.053922Z"},"links":{"citing_paper":"/paper/2506.02178"},"observation_digest":"sha256:c6787f5f7c54a3522c59f5d591c8026f0c547c20fa2af57dd7f428a52c56b1bb","observation_id":"07a0f896-1316-491a-a9f5-6c8445a1a8ee","resolution":{"observed_at":"2026-08-07T11:33:52.651124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02178","last_updated":"2025-06-02T19:07:51Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T11:26:52.379861Z","submitted_at":"2025-06-02T19:07:51Z","title":"Cocktail-Party Audio-Visual Speech Recognition"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.02178."}