{"as_of":"2026-08-17T18:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5834e4f545336a37754fa0039b20588fb4893bf3d2d41f5028e2c6da5d14d7b3","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:02:14.805352Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.03186/citation-record","integrity":"/paper/2505.03186/integrity","json":"/paper/2505.03186/citation-record.json","paper":"/paper/2505.03186"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.575052Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.575052Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:ce9568f7febb85e817bc0c450ed5bd2c1c155b2801f11c4cabd4683c87c49250","observation_id":"3ac9d1eb-96a8-49c5-b3b3-662a4e4126b6","resolution":{"observed_at":"2026-08-16T00:02:14.575052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-16T13:36:59.551255Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-16T00:02:14.581161Z","title":"Funaudiollm: V oice understanding and generation foundation models for natural interaction between humans and llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.581161Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:828cd862610c0f1b2bb46053ef7d2bcbc9ee35b8e61713f7fa14c6af8a8a3d0e","observation_id":"626beae2-331e-40c3-8d07-f7e07c6f1686","resolution":{"observed_at":"2026-08-16T00:02:14.581161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.586465Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.586465Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:3c5b892c243401f2c67d66b1cf051edc496ce7b461285b4342cb4718b9caab4a","observation_id":"bbf19573-56c2-41df-8141-8454e2d90440","resolution":{"observed_at":"2026-08-16T00:02:14.586465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.592073Z","title":"Qwen2-audio technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.592073Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:c5669ccd51ad4fe09289b98ff25f92c3a6fbce229ae34f761ce1a0d066848351","observation_id":"89ee59dd-884d-426b-9b54-0dce5284d186","resolution":{"observed_at":"2026-08-16T00:02:14.592073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.597519Z","title":"Assessment for automatic speech recognition: Ii","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.597519Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:29f0e3e86a609e5bdddb0883d0b8561f7ad090da8478dedb7ae708cc75a3323f","observation_id":"b8ae44e0-4685-4a19-88e0-25d0f1ebae40","resolution":{"observed_at":"2026-08-16T00:02:14.597519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.490417Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels","venue":null,"work_id":"4d6acda2-927d-456d-88f9-08ccf8873408","year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.602336Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:384650ce19b9486624364b7c531eae2135d41753195f1825110a9c04f965aa5d","observation_id":"18e863d1-c7b0-4231-a73e-1fa10e3e797f","resolution":{"observed_at":"2026-08-16T00:02:15.495059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01547","last_updated":"2025-05-07T13:06:56Z","snapshot_observed_at":"2026-08-17T16:55:09.443445Z","submitted_at":"2025-02-03T17:29:52Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","version":3},"cited_work":{"arxiv_id":"2502.01547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.01547","snapshot_observed_at":"2026-08-16T00:02:14.902604Z","title":"mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition","venue":"eess.AS","work_id":"26b85104-1fc9-4c5b-94d9-c738cd2e6630","year":2025},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.608210Z"},"links":{"cited_paper":"/paper/2502.01547","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:c0834c72221e8ab5aefb99d32ed61e669f0f981e7004ed531cdc2c1eaad38c93","observation_id":"31658b4e-5454-4c42-a0c0-c56795cce0fb","resolution":{"observed_at":"2026-08-16T00:02:14.909462Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.474737Z","title":"Xlavs-r: Cross-lingual audio-visual speech representation learning for noise-robust speech perception, 2024","venue":null,"work_id":"8cf29956-de67-4810-aaf4-bef130889d02","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.613614Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:83fbc3ddf5e70c176ae4bbd8144cb8a20966078c48393738899bf2de2ca9763a","observation_id":"69e8cff1-ce87-47ee-8f48-4bf620f51cb2","resolution":{"observed_at":"2026-08-16T00:02:15.480421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-16T17:30:04.943064Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-16T00:02:14.618734Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.618734Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:c447900519e6cdf2f3d95de8198cbc3e85242f2f6a093a7abaa7a1fdb7ae3b96","observation_id":"a5ea468d-4a1f-4257-a40e-c9b49796ebc2","resolution":{"observed_at":"2026-08-16T00:02:14.618734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.459662Z","title":"Unified speech recognition: A single model for auditory, visual, and audiovisual inputs, 2024","venue":null,"work_id":"8ea277ad-f46d-483d-8cca-fe267fcf686d","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.623425Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:43de6fcdcd8639561b00aea7505dbdbd5900c4052194fd8de60653249cd0e1c6","observation_id":"99d9da77-5ffd-4467-b0f9-98f8463fde04","resolution":{"observed_at":"2026-08-16T00:02:15.464167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.444513Z","title":"Speech recognition models are strong lip- readers","venue":null,"work_id":"865edd0d-3aa8-434d-b88c-dcf1bd9b93ac","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.627623Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:5d16c638d11f39f8843d6c8db36310533b3c40839e0dca4965ec289339e26328","observation_id":"4ee4a0e4-4941-4724-95f9-13f75958055a","resolution":{"observed_at":"2026-08-16T00:02:15.449473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10082","last_updated":"2024-11-19T21:19:43Z","snapshot_observed_at":"2026-08-16T13:42:55.650200Z","submitted_at":"2024-06-14T14:36:54Z","title":"Whisper-Flamingo: Integrating Visual Features into Whisper for Audio-Visual Speech Recognition and Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10082","snapshot_observed_at":"2026-08-16T00:02:14.631987Z","title":"Whisper-flamingo: Integrating visual features into whisper for audio-visual speech recognition and translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.631987Z"},"links":{"cited_paper":"/paper/2406.10082","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:ba8efdd794871f931af874dc996f2b217b1325c4ef2ce8a093cfc612685810fa","observation_id":"14646b13-963a-4262-9c08-d723ac268e36","resolution":{"observed_at":"2026-08-16T00:02:14.631987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.429739Z","title":"van de Ven, Nicholas Soures, and Dhireesha Kudithipudi","venue":null,"work_id":"7c6f399c-1441-4cdb-abfb-3d2e9fc0ef40","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.636993Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:d4b03f88248e814b37f40831759df6e6c778503cb55cf18fbb9179ce5c7f723c","observation_id":"5ea2047c-6fb3-401f-8059-8d4a7f85e7d0","resolution":{"observed_at":"2026-08-16T00:02:15.434451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.415343Z","title":"Lip reading sentences in the wild","venue":null,"work_id":"6e7363fd-0fa8-4c26-8913-34189273250e","year":2017},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.641960Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:246856c3422e1b55ac78f2e168dcac31e669d2d6bdbe32712ccdcb329834b825","observation_id":"6d79bc66-5e5f-44d1-b6b7-8df976f3894d","resolution":{"observed_at":"2026-08-16T00:02:15.420078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.401033Z","title":"Maas: Multi-modal assignation for active speaker detection","venue":null,"work_id":"581a1c64-563f-4c23-9c5d-7231c0b04c5c","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.646482Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:5ae988b4eb7169b3c9786deac09cd43f72ea66a7c50afe90a86ae51caf055e08","observation_id":"9f2bd975-770e-4681-b5fb-98a978667072","resolution":{"observed_at":"2026-08-16T00:02:15.405666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.650794Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.650794Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:1b11ee4182387c71f8e8d1385a5382e913b6334ed78321af432d7bea2e99108e","observation_id":"4e685917-7581-4da2-b044-28ecc04cadc3","resolution":{"observed_at":"2026-08-16T00:02:14.650794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.655093Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.655093Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:54e706125b006d06473938f110f288926b59ea309d66abeff3518c23b9202698","observation_id":"40a0b99c-cd91-4b60-a5a3-64a0b827c765","resolution":{"observed_at":"2026-08-16T00:02:14.655093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-16T20:23:00.161927Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-16T00:02:14.659428Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.659428Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:98b5a7305dcf735fff03effe2fc388e28b32b529796f94f9de2dde14c4d83c75","observation_id":"9faab5e2-a5a3-4722-84e2-dac9fc254347","resolution":{"observed_at":"2026-08-16T00:02:14.659428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.366409Z","title":"Asr is all you need: cross-modal distillation for lip reading, 2020","venue":null,"work_id":"88bca7cf-be53-4cc7-bd93-8773df9274e4","year":2020},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.663974Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:df04c0b3d38525812b3c45a415813d595905dbdbf917f7ae8c3420d21ba13937","observation_id":"ae52f234-c1ae-4b5f-a74d-31bc48f3a648","resolution":{"observed_at":"2026-08-16T00:02:15.371184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.352480Z","title":"Schuller, and Maja Pantic","venue":null,"work_id":"37c7193c-bc4d-4b79-8154-30cdb32aa6be","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.668210Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:d73b04c0c5998230d8cfbba3043ac7a12df9e9645051bb96275d1508d3c02e8c","observation_id":"1108b9bb-53f2-4992-a221-18a83f7e9e60","resolution":{"observed_at":"2026-08-16T00:02:15.356605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.338009Z","title":"u-hubert: Unified mixed-modal speech pretraining and zero-shot transfer to unlabeled modality, 2022","venue":null,"work_id":"c0cc2a2a-84b6-4126-9309-d0d13a245858","year":2022},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.672686Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:33a1d6bafe43aa576813271c6433d207506abd0c78659347f4cdead4bc8238e7","observation_id":"92fc2400-5d70-4ad9-91dc-86d271b22ca8","resolution":{"observed_at":"2026-08-16T00:02:15.342794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.323801Z","title":"Av-data2vec: Self-supervised learning of audio-visual speech representations with contextualized target representations, 2024","venue":null,"work_id":"76f53588-cdbe-4b11-acbf-fb6976e3df94","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.676961Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:10a57781c1dc90b326c09d1de8793c328ae3d887c98e6134fceb71b81dc3fe23","observation_id":"56b24ef1-c4cc-49f2-b99a-859acfff1e0a","resolution":{"observed_at":"2026-08-16T00:02:15.328435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.308365Z","title":"Vatlm: Visual-audio-text pre-training with unified masked prediction for speech representation learning","venue":null,"work_id":"78296285-f995-4c4e-8beb-d1c46cbe9ba3","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.681001Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:2b1c374ff2081baee2dfbd3ab455e3523fc2f663a89d58df9db74ccc8a2f7900","observation_id":"9ea9bd24-eaa7-4d29-802c-09159655c654","resolution":{"observed_at":"2026-08-16T00:02:15.314319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.685115Z","title":"Conformer: Convolution-augmented transformer for speech recognition, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.685115Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:711d74cbbff11162bef75c805a7ba6bff8f3910859d995c5f8d847356268cbd9","observation_id":"38f8b3c4-a53a-4c7c-bd27-8c4eca718d53","resolution":{"observed_at":"2026-08-16T00:02:14.685115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.283943Z","title":"Multilingual audio-visual speech recognition with hybrid ctc/rnn-t fast conformer","venue":null,"work_id":"b26d8ecb-4c2f-4105-a2f2-6b6e21935e1c","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.690215Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:00445918b4140cf84f77dac88dd197ec5a9eb6b9ebb2a3a495935b1cf9a94827","observation_id":"87103140-2d4c-47aa-a9fa-5dfd522edce5","resolution":{"observed_at":"2026-08-16T00:02:15.288628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.695123Z","title":"Lrs3-ted: a large-scale dataset for visual speech recognition, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.695123Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:002845bb3437d22ccfa279a20744813eaecd2a7ecb184f76b3966ea1f786cb14","observation_id":"f2c10cca-c52b-4b20-8197-d95c478c2fa3","resolution":{"observed_at":"2026-08-16T00:02:14.695123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00628","last_updated":"2023-03-07T16:41:01Z","snapshot_observed_at":"2026-08-16T15:51:40.199718Z","submitted_at":"2023-03-01T16:31:01Z","title":"MuAViC: A Multilingual Audio-Visual Corpus for Robust Speech Recognition and Robust Speech-to-Text Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00628","snapshot_observed_at":"2026-08-16T00:02:14.699358Z","title":"Muavic: A multilingual audio-visual corpus for robust speech recognition and robust speech-to-text translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.699358Z"},"links":{"cited_paper":"/paper/2303.00628","citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:3aaa6ee2619c6daaa571636cf7b5b9af3f8a8faa57e4d5d0e5c1efe9ab52ebcc","observation_id":"c6b12aa4-1e3a-49f9-98c3-f0fe336b05b8","resolution":{"observed_at":"2026-08-16T00:02:14.699358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.259166Z","title":"Braven: Improving self-supervised pre-training for visual and auditory speech recognition, 2024","venue":null,"work_id":"e54e5eba-dbdb-491c-ad4a-f285468b6ee3","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.703772Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:6a7b9d2abd5ea41ce42ba994ea1f412de82232c86d418b7372ae250cba955f75","observation_id":"9f401350-0f5e-4d95-9617-f9bb28436777","resolution":{"observed_at":"2026-08-16T00:02:15.263968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.708017Z","title":"Large language models are strong audio-visual speech recognition learners, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.708017Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:e3723aa4beafb4bdfd982dc348987280cef6523bfd931a3b2a6efe0399c73a07","observation_id":"7e0f453d-368b-4502-bfa2-bcdfc91b8238","resolution":{"observed_at":"2026-08-16T00:02:14.708017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.234024Z","title":"Visualvoice: Audio-visual speech separation with cross-modal consistency, 2021","venue":null,"work_id":"123af017-3e26-498d-a21d-97ad6f39da6c","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.712253Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:7a60b846105668b879ef8d2f1bfc9fe4749cce6ea47c6c85df151adca8e7abb4","observation_id":"a4c61101-e1e3-4c65-bfe4-7ef2d5ad22b7","resolution":{"observed_at":"2026-08-16T00:02:15.238909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.219230Z","title":"Ctcnet: A cnn- transformer cooperation network for face image super-resolution","venue":null,"work_id":"af38eb37-4f52-4254-9979-7fff7af67965","year":1978},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.716572Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:1d9c8631a3a2d25ebbbac94183f17920ef2009aac170273393a1f667a893de64","observation_id":"b9740d49-4e6c-4702-b84c-f0d4c86339d1","resolution":{"observed_at":"2026-08-16T00:02:15.224269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.204035Z","title":"Muse: Multi-modal target speaker extraction with visual cues, 2021","venue":null,"work_id":"eed9284f-d52f-448c-9b9b-4c1717696e8b","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.720990Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:789dba49d7354d99cf1014a89af44f42c0994dab2651ce2fd27d0dc931f02446","observation_id":"5127e6c6-1d23-4421-ad8e-df41f411260e","resolution":{"observed_at":"2026-08-16T00:02:15.209791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.189187Z","title":"Av-sepformer: Cross-attention sepformer for audio-visual target speaker extraction, 2023","venue":null,"work_id":"1a4bcb14-4bef-4743-8b30-415257c2c35e","year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.725497Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:b288740ec65e4ec2d8768b835346183e627465a1c5777f169612ec530b7fcf0f","observation_id":"4de8b763-bce7-4c53-9f63-e2b381b24b73","resolution":{"observed_at":"2026-08-16T00:02:15.193757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.174497Z","title":"Attention is all you need in speech separation, 2021","venue":null,"work_id":"fd084dbc-8de8-4ce9-96b1-6c377b13f9ea","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.729752Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:8ed34899fcbea8cafd3a1ec4812a7be61e556f1a0fe5104442d664ec412b8344","observation_id":"86797946-3f20-476d-9058-dc0a29b65927","resolution":{"observed_at":"2026-08-16T00:02:15.179881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.158145Z","title":"Separate in the speech chain: Cross-modal conditional audio-visual target speech extraction, 2024","venue":null,"work_id":"01f296d2-689a-4e84-bfb3-a8690da82b94","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.734164Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:cb7b557c3f445d69c97a112796717b511e99feb4d07cbf8f1e091db693668405","observation_id":"2306f3dc-d4e5-4afd-b244-0d46e6daa9c1","resolution":{"observed_at":"2026-08-16T00:02:15.163493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.142604Z","title":"A light weight model for active speaker detection, 2023","venue":null,"work_id":"c56771b6-bbb5-4ae4-9ea2-113c152a8ef0","year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.738490Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:cd54ee986a2a476444e7969f2f163ba6a77060e04146484d0b693cd7c320cac7","observation_id":"42cc8e8e-7598-4613-b881-5b0a41f0a44a","resolution":{"observed_at":"2026-08-16T00:02:15.147444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.128484Z","title":"End-to-end active speaker detection, 2022","venue":null,"work_id":"1c469adf-8ea1-492f-bf21-7cda6e6c46f6","year":2022},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.743048Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:26227eae188c77623c1529704f83fad2965c3b93e0ba747bf24d21ffa1179c8f","observation_id":"efdd07a1-4504-4b6e-9538-2dfe98b7b255","resolution":{"observed_at":"2026-08-16T00:02:15.132880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.113801Z","title":"Loconet: Long-short context network for active speaker detection, 2024","venue":null,"work_id":"653d41ff-ee9a-4fcf-911f-b18e83478c59","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.747136Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:28573b0784a3983bfdb72438d76335fbc4311f30681b93f0f077642c2d39b01b","observation_id":"f4bdcfad-cf29-4f35-bd6d-5257cdf90f1f","resolution":{"observed_at":"2026-08-16T00:02:15.118510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.099467Z","title":"Lr-asd: Lightweight and robust network for active speaker detection","venue":null,"work_id":"ecd0dc01-4176-44b4-99ca-5c4894501ef2","year":2025},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.751398Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:7c08ebd36543521f5d5a2d34312d6403a9cc4505af3f58b4c2cd6eb95975d0c6","observation_id":"961a5d6d-51b1-41b1-af05-564ebfbbf10b","resolution":{"observed_at":"2026-08-16T00:02:15.104097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.083846Z","title":"Tdn: Temporal difference networks for efficient action recognition, 2021","venue":null,"work_id":"2148bcf6-fabe-434a-be37-d4ab08798f6b","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.755649Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:cd39f2fee7b186cac9fab24a7abb1dc96745e78851707b93476dfae126d22608","observation_id":"ea3bdbd8-7c68-4200-a748-65a4d799d393","resolution":{"observed_at":"2026-08-16T00:02:15.089734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.759904Z","title":"Dauphin, Angela Fan, Michael Auli, and David Grangier","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.759904Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:83e3cbc1314acd7ae33d8f7e66427990a2268b8b8de1c0ed08361140337779ea","observation_id":"f3be7b5b-adc9-468b-9668-f40f52bc606d","resolution":{"observed_at":"2026-08-16T00:02:14.759904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.764101Z","title":"Musan: A music, speech, and noise corpus, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.764101Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:71e6f234f22ea0cad7a03a039eccda9a7cd47ad3c4851305277719342797aa8b","observation_id":"23630693-a3ce-4533-b4ae-8efd72aa2bd1","resolution":{"observed_at":"2026-08-16T00:02:14.764101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.768340Z","title":"Audio- visual speech recognition with a hybrid ctc/attention architecture, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.768340Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:0d235ac8856e428e81ae713d35dc9e734317ab2d11ad4331e79ba000ecb85c47","observation_id":"04d071a2-fb16-4b7b-bb6d-b6a310bdfb8d","resolution":{"observed_at":"2026-08-16T00:02:14.768340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.041231Z","title":"Es3: Evolving self-supervised learning of robust audio-visual speech representations","venue":null,"work_id":"1c7788f1-40fc-42eb-a839-6653a2ca957d","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.772581Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:9d22153ca286a348663f36aa563a1e6bf6159b41ce2edff7a557c8a797901db8","observation_id":"c07be99f-6f8c-4ca5-b7a2-81137f33c9d7","resolution":{"observed_at":"2026-08-16T00:02:15.045641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.026882Z","title":"Syncvsr: Data-efficient visual speech recognition with end-to-end crossmodal audio token synchronization, 2024","venue":null,"work_id":"d2285411-8029-4670-b5fc-324e01a5c200","year":2024},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.777319Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:8bc687deabe48f66f547247f315fd57f2d1d39ab73dc0f6f38e8dcaa3d3755b1","observation_id":"73c5d417-7494-4daf-940f-cf1880addee0","resolution":{"observed_at":"2026-08-16T00:02:15.031534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:15.011498Z","title":"Sub-word level lip reading with visual attention, 2021","venue":null,"work_id":"0a18cdd0-57a3-46e8-b458-5d44e50e8e45","year":2021},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.781608Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:f985659cc24c8103fecabfb2529ef477e02e1c69784b5c1b5499384b49533fb2","observation_id":"6d3df58b-f8ac-4d6b-a411-aca47a226325","resolution":{"observed_at":"2026-08-16T00:02:15.016589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.996194Z","title":"Deep audio-visual speech recognition","venue":null,"work_id":"0bb0b36e-a76e-4ca3-b606-008c4648ca71","year":2022},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.787191Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:9432ba1393d8374063f2c4985269f2ac99aff99db5f01b27d146898ba28ffd0e","observation_id":"d5b44847-8856-4c5c-98f2-8588f060171a","resolution":{"observed_at":"2026-08-16T00:02:15.000505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.982041Z","title":"Leveraging unimodal self-supervised learning for multimodal audio-visual speech recognition, 2022","venue":null,"work_id":"17300901-358a-4ac4-8e51-182766880e77","year":2022},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.792140Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:f5499ff0143701e2f9d24b374112288ddf3c6720877f3a797191fbbabfb3d42c","observation_id":"88998e02-a846-4a4b-80e2-f2dce41aa850","resolution":{"observed_at":"2026-08-16T00:02:14.986821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.967326Z","title":"Audio-visual efficient conformer for robust speech recognition, 2023","venue":null,"work_id":"d300da62-1b74-47d0-a63a-cb5fa8482b31","year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.796585Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:7330d48c0bfe0648050a84cfa98aec07280fbd0fb2f2080d2781273f6bb43c9e","observation_id":"d474d59e-b104-4927-8778-875557e3b091","resolution":{"observed_at":"2026-08-16T00:02:14.972183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.952926Z","title":"Audio-visual speech enhancement and separation by utilizing multi-modal self-supervised embeddings, 2023","venue":null,"work_id":"762bbd5c-0891-463b-a950-b075ffb73f3e","year":2023},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.801054Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:e340bb3fcc65f48ea9d1850340dcfccb0638e99a3c4d2bfc69bda999c71b9092","observation_id":"d8750052-a914-4197-980a-68f7e040c139","resolution":{"observed_at":"2026-08-16T00:02:14.957484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:14.937794Z","title":"Time domain audio visual speech separation, 2019","venue":null,"work_id":"32959086-ef50-4188-8d52-a0b9177a7665","year":2019},"citing_paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:14.805352Z"},"links":{"citing_paper":"/paper/2505.03186"},"observation_digest":"sha256:6b9d9bea7c5f660ff656e81a7fcc32c5d984fe1267a19f15f13a197c5c94db4b","observation_id":"1412804f-e3a4-46f8-be06-6b245d5192ae","resolution":{"observed_at":"2026-08-16T00:02:14.942609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.03186","last_updated":"2025-05-15T07:21:04Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T11:54:24.959699Z","submitted_at":"2025-05-06T05:07:11Z","title":"CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2505.03186."}