{"as_of":"2026-08-08T23:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:50a51c7a0f9fa42ba73be458e6daeab0d7fdaa438276e96dfa7a9cadbad00828","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:05.021485Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:00.946933Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T08:09:51.394586Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-08-07T15:43:00.946933Z","title":"These sce- narios present considerable challenges due to adverse acoustic conditions, including far-field audio, background noise, and re- verberation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:00.946933Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:d028ef62bc787f23aac46c1fd7feafa65dfbc5e248040002f9019307a2bc2c83","observation_id":"d516a4d6-1b5c-43fa-bd6f-344aae0d6d84","resolution":{"observed_at":"2026-08-07T15:43:00.946933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-08-07T13:23:26.572189Z","title":"The multimodal information based speech processing (misp) 2025 challenge: Audio-visual diarization and recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22013","last_updated":"2025-05-28T06:22:37Z","snapshot_observed_at":"2026-08-08T10:18:11.060579Z","submitted_at":"2025-05-28T06:22:37Z","title":"Overlap-Adaptive Hybrid Speaker Diarization and ASR-Aware Observation Addition for MISP 2025 Challenge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:23:26.572189Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2505.22013"},"observation_digest":"sha256:787f1767e691bfa72e1d9af51d5d663d54dd30b2c6c5c0da3ca693d2e1494c73","observation_id":"02c18a0e-adb3-4d68-9574-028150db69db","resolution":{"observed_at":"2026-08-07T13:23:26.572189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-08-07T00:21:56.777201Z","title":"The multimodal information based speech processing (misp) 2025 challenge: Audio-visual diarization and recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14427","last_updated":"2025-06-28T05:50:08Z","snapshot_observed_at":"2026-08-08T08:23:57.394977Z","submitted_at":"2025-06-17T11:44:20Z","title":"M3SD: Multi-modal, Multi-scenario and Multi-language Speaker Diarization Dataset","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:21:56.777201Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2506.14427"},"observation_digest":"sha256:623398c14538e0ead60c50f767bcbfb2c05db6a2ab0e7b721c041fed0db25911","observation_id":"dca6c443-3407-4b0b-92fb-977eb884cbde","resolution":{"observed_at":"2026-08-07T00:21:56.777201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":"2505.13971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The multimodal information based speech processing (misp) 2025 challenge: Audio-visual diarization and recognition","venue":null,"work_id":"744345ac-0d40-4730-b6ea-9aa162e52f81","year":2025},"citing_paper":{"arxiv_id":"2604.13073","last_updated":"2026-03-20T17:25:00Z","snapshot_observed_at":"2026-07-06T23:01:10.333101Z","submitted_at":"2026-03-20T17:25:00Z","title":"OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T08:06:45.477344Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2604.13073"},"observation_digest":"sha256:c58043414ca9e54dfff0aa415f9cfaa1b41f022a08acc461ee92c2775afd7384","observation_id":"06774b7d-55b1-42a7-abae-e6f845a405cf","resolution":{"observed_at":"2026-05-15T08:09:51.398870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":"2505.13971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The multimodal information based speech processing (misp) 2025 challenge: Audio-visual diarization and recognition","venue":null,"work_id":"744345ac-0d40-4730-b6ea-9aa162e52f81","year":2025},"citing_paper":{"arxiv_id":"2604.22467","last_updated":"2026-04-24T11:43:25Z","snapshot_observed_at":"2026-07-31T06:13:14.722604Z","submitted_at":"2026-04-24T11:43:25Z","title":"DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T09:18:53.285951Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2604.22467"},"observation_digest":"sha256:5c3837053a47ff6ad9f43b30e0fb32730f47e5654565e6630389df7ebbe27e71","observation_id":"038ca04a-f233-43de-a3f7-8b08fa5f8d8a","resolution":{"observed_at":"2026-05-11T20:21:12.615570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-08-01T13:06:07.806541Z","title":"The multimodal information based speech Tsinghua University | 14 processing (misp) 2025 challenge: Audio-visual diarization and recognition.arXiv preprint arXiv:2505.13971, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19235","last_updated":"2026-07-21T16:05:49Z","snapshot_observed_at":"2026-08-06T17:51:14.292845Z","submitted_at":"2026-07-21T16:05:49Z","title":"MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T13:06:07.806541Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2607.19235"},"observation_digest":"sha256:681a3989724e38ad957ebf1d6ad0a98680ed566e80e9becac77d41a7331f33cd","observation_id":"38be85af-3c4d-473d-960a-35da92a73616","resolution":{"observed_at":"2026-08-01T13:06:07.806541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13971/citation-record","integrity":"/paper/2505.13971/integrity","json":"/paper/2505.13971/citation-record.json","paper":"/paper/2505.13971"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13971","snapshot_observed_at":"2026-08-07T15:43:00.946933Z","title":"These sce- narios present considerable challenges due to adverse acoustic conditions, including far-field audio, background noise, and re- verberation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:00.946933Z"},"links":{"cited_paper":"/paper/2505.13971","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:d028ef62bc787f23aac46c1fd7feafa65dfbc5e248040002f9019307a2bc2c83","observation_id":"d516a4d6-1b5c-43fa-bd6f-344aae0d6d84","resolution":{"observed_at":"2026-08-07T15:43:00.946933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.308173Z","title":"Statics The MISP-Meeting dataset[10] comprises a total of 125 hours of synchronized audio and video data, meticulously curated to reflect real-world meeting scenarios","venue":null,"work_id":"08b0925f-912e-4ef0-8907-6098cb1546ea","year":null},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.015198Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:a5bc569ff71fe7a30bcc82143281b4d1c86c34188235e04a4ceaa5c423f12ab7","observation_id":"d182b9a8-a55d-4e53-a58c-b0807a475f2c","resolution":{"observed_at":"2026-08-07T15:43:10.405861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.081253Z","title":"who spoke when","venue":null,"work_id":"4c1fb640-923a-4bb7-afce-b1c262108e22","year":null},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.131980Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:dbb76d12cb4dd86dee325c133d0fd1c6e831ddb7b1f56fcc3d43199b9c2fc4ca","observation_id":"4617894b-5ab6-4b5d-b4c4-abceef6f4b8f","resolution":{"observed_at":"2026-08-07T15:43:10.171540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.892807Z","title":null,"venue":null,"work_id":"508107ec-91c3-42dd-a5a5-dd3a49a9ae4d","year":null},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.253337Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:79d6b5bda0ec36aaca3c942e601e9cb99a190b6fe36e56bc638202a50a7f5ac9","observation_id":"63d2ca25-9035-4f8f-9644-6e043c78bd31","resolution":{"observed_at":"2026-08-07T15:43:10.001010Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.709535Z","title":"(2), whereNspk is the total number of speakers in the session","venue":null,"work_id":"50bc5b65-eb04-412c-b5ce-96dba78968a6","year":null},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.356018Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:4409d96d2c6eca5acacfdb20aaef9147550bab56d55d57a348fb86d1b31756b1","observation_id":"af8c5e2b-7ce1-461d-9630-7081a33c5d9e","resolution":{"observed_at":"2026-08-07T15:43:09.796298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.412181Z","title":null,"venue":null,"work_id":"5bc903ee-46cc-4d6f-9a68-40339a413598","year":null},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.496388Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:a464f90580e4eef9c46bf61bae44e17ee595c3976cb91cd59cba3dd1aca29252","observation_id":"fd03b07a-e841-49f1-965a-560307c032da","resolution":{"observed_at":"2026-08-07T15:43:09.545159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.212190Z","title":"A VSD Table 2 presents a summary of the methods and results for Track 1 (Audio-Visual Speaker Diarization) in the MISP 2025 Challenge","venue":null,"work_id":"1d12cc91-95be-4fb2-8e30-8ff0ab10cded","year":2025},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.616838Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:4606964cf0af505e659f09e9dc138c6a303eb316916d1632331605db69d7fc82","observation_id":"fabb067c-e0b7-4de2-9160-4bc51668a496","resolution":{"observed_at":"2026-08-07T15:43:09.281598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.972503Z","title":null,"venue":null,"work_id":"79c4ad7b-920d-4a9f-858c-022adc0d3485","year":2025},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.738485Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:a5894e842c8823146f8f3936bbccd31a99a3dc7f446921242202d1df028889a9","observation_id":"095c7367-1392-4e02-a4bd-1df23564b5f2","resolution":{"observed_at":"2026-08-07T15:43:09.111934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.729275Z","title":"The chil audiovisual corpus for lecture and meeting analysis in- side smart rooms,","venue":null,"work_id":"32a78548-ba3a-49cb-a1d3-f64c0e6c46f2","year":2007},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.825645Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:7d051c200b2027164f4e28ccdc740c8a8a675fa088a9002446cb2e10f52d06a7","observation_id":"1ee43906-d77d-4382-a9c1-11056bb6132d","resolution":{"observed_at":"2026-08-07T15:43:08.828947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.538077Z","title":"M2met: The icassp 2022 multi- channel multi-party meeting transcription challenge,","venue":null,"work_id":"4cd51c66-7873-4721-a3e4-4e3a242f6df5","year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:01.970675Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:368f94a51b2f77143275d4f69ae8e04f0c51c97e178375279d2c004e2e33757a","observation_id":"94b03a91-ce32-48d7-8791-45fde30cb4a5","resolution":{"observed_at":"2026-08-07T15:43:08.634867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03603","last_updated":"2021-08-10T09:15:00Z","snapshot_observed_at":"2026-07-06T10:57:34.353038Z","submitted_at":"2021-04-08T08:38:44Z","title":"AISHELL-4: An Open Source Dataset for Speech Enhancement, Separation, Recognition and Speaker Diarization in Conference Scenario","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03603","snapshot_observed_at":"2026-08-07T15:43:02.079339Z","title":"Aishell-4: An open source dataset for speech enhancement, separation, recognition and speaker diarization in conference scenario,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.079339Z"},"links":{"cited_paper":"/paper/2104.03603","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:32bd4c7025cacba024e764482769cd80a6f01e50a48b404b7afd422334166771","observation_id":"474dda51-9528-4bbb-86e4-476a84c651c5","resolution":{"observed_at":"2026-08-07T15:43:02.079339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.307695Z","title":"Continuous speech separation: Dataset and analysis,","venue":null,"work_id":"12ee6e3f-845a-472b-9393-5def4fde70ae","year":2020},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.211446Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:47c649339b558279982c8ccbbaecd5ac5dc908fd8759eaa2243aa5a629471757","observation_id":"24dda821-8acf-4170-af19-ffb35fec1c65","resolution":{"observed_at":"2026-08-07T15:43:08.436561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.305820Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.305820Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:d6e4897a7568fe5a293d3bc2a449239209a03cf47dc9cc89ef5354fdd8ceb7fd","observation_id":"e9c3e128-15c4-4b6e-ac08-f377e39382e2","resolution":{"observed_at":"2026-08-07T15:43:02.305820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.068572Z","title":"CHiME-6 Chal- lenge: Tackling Multispeaker Speech Recognition for Unseg- mented Recordings,","venue":null,"work_id":"e73ee50f-e19a-4d34-a3e9-bc013b8859b3","year":2020},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.459989Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:07e951c1965947031c76ce3ebacf121ce965c712b5c1f153dce27e71a8eaea49","observation_id":"ef7adc73-dd1c-4ab8-b3d1-cf8b99dd345f","resolution":{"observed_at":"2026-08-07T15:43:08.186566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.865595Z","title":"The first multimodal information based speech processing (misp) chal- lenge: Data, tasks, baselines and results,","venue":null,"work_id":"9fb2f5c2-8c66-4d08-9290-8a7b42bdf337","year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.614902Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:5d0f022380e5ec70d8844e2330c531617b942a11bd320da16e8f86758d4575d9","observation_id":"5b477c2d-8e4a-450f-bd4f-280b2da4535e","resolution":{"observed_at":"2026-08-07T15:43:07.989009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:02.797124Z","title":"The mul- timodal information based speech processing (misp) 2022 chal- lenge: Audio-visual diarization and recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.797124Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:f19ee2731dad3cdf163c925aef04c9969438d87f208b7eae854b0520658e4b09","observation_id":"bea85d7f-dd75-41a5-bfda-ee982ef8a884","resolution":{"observed_at":"2026-08-07T15:43:02.797124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.663246Z","title":"The multimodal information based speech processing (misp) 2023 challenge: Audio-visual target speaker extraction,","venue":null,"work_id":"148e2062-410c-4063-8b2b-e13631a8d2ae","year":2023},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:02.876803Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:2ef1d1ef17abb9178d07335dabedc8e34bb4aa85c0f42df6042a8d04d64bf740","observation_id":"9c480d17-e3da-41ee-96c7-d54cb0103dbc","resolution":{"observed_at":"2026-08-07T15:43:07.764255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.014747Z","title":"MISP-Meeting: A real-world dataset with multimodal cues for long-form meeting transcription and summarization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.014747Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:086c4b21f0a16b0cddd759648e1478d277eeee86980aa6b95baa39968f79e088","observation_id":"c4e4131e-df16-4fd3-abab-13d0adc854ab","resolution":{"observed_at":"2026-08-07T15:43:03.014747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.399354Z","title":"End-to-end audio-visual neural speaker diarization,","venue":null,"work_id":"b5211a14-5c29-466f-b3b0-bc930feb5226","year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.076635Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:3c40b550faf7060d22ab7e5dadbe2ba4d8892218908358438152b64dc1282f77","observation_id":"b75b325c-4bf8-4d38-a95a-702aac5698b2","resolution":{"observed_at":"2026-08-07T15:43:07.550360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T15:43:03.146074Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.146074Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:e3568b934f5e804de073c34882df94cb4ca13997cae3961cd2070ffcb9a53b20","observation_id":"75b3023e-f670-4324-8b08-aae5b29f9a25","resolution":{"observed_at":"2026-08-07T15:43:03.146074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:03.211149Z","title":"Dover-lap: A method for com- bining overlap-aware diarization outputs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.211149Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:6f713807362f4bcc231c2a15d5d579e309a119300cc3ded93b7956df0f07eccd","observation_id":"26e1751a-a452-4788-af8f-6fa7d246e9df","resolution":{"observed_at":"2026-08-07T15:43:03.211149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.052574Z","title":"The rich transcription 2006 spring meeting recognition evaluation,","venue":null,"work_id":"19d65133-90e2-4f50-bd32-a0badcb029ac","year":2006},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.345208Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:75d83d20e878d7d266fb00862cbf4ab5b92f2b754b2beb6bf675a79e58a80058","observation_id":"5d52c1c3-c08a-496c-be86-9f1f01c3556f","resolution":{"observed_at":"2026-08-07T15:43:07.172677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.848100Z","title":"Improving audio-visual speech recognition by lip-subword correlation based visual pre-training and cross-modal fusion encoder,","venue":null,"work_id":"b2cc708d-c51a-4fcc-93d4-5b3ee47ab936","year":2023},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.405144Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:5f551364ef99d7800bb880e048b11361d267a26506804e91233165b105452784","observation_id":"d7c11625-c882-412a-bdda-0e38ad429a5e","resolution":{"observed_at":"2026-08-07T15:43:06.921969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05271","last_updated":"2023-08-13T18:30:43Z","snapshot_observed_at":"2026-08-02T11:59:18.040781Z","submitted_at":"2022-12-10T11:20:17Z","title":"GPU-accelerated Guided Source Separation for Meeting Transcription","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05271","snapshot_observed_at":"2026-08-07T15:43:03.476909Z","title":"Gpu-accelerated guided source separation for meeting transcription,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.476909Z"},"links":{"cited_paper":"/paper/2212.05271","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:7d0bab5c4108fb5527804b6b78af2130ed1008692a3e5c3020c4d37564cc4ffa","observation_id":"0458f9e8-8c9c-4667-956e-6af705fe8edf","resolution":{"observed_at":"2026-08-07T15:43:03.476909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.421462Z","title":"The multimodal information based speech processing (misp) 2022 challenge: Audio-visual di- arization and recognition,","venue":null,"work_id":"7f1eb7ba-9886-4deb-a8aa-8debf7e8e3e0","year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.600303Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:b4c4b518df11bfeb2cd724b8d2759aefc37b01a30e751df7c7e709b3b6c49577","observation_id":"92676c42-0012-47ee-9ef8-aa8e151969eb","resolution":{"observed_at":"2026-08-07T15:43:06.650135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11510","last_updated":"2024-07-16T08:49:30Z","snapshot_observed_at":"2026-07-06T18:47:00.524107Z","submitted_at":"2024-07-16T08:49:30Z","title":"VoxBlink2: A 100K+ Speaker Recognition Corpus and the Open-Set Speaker-Identification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11510","snapshot_observed_at":"2026-08-07T15:43:03.767045Z","title":"V oxblink2: A 100k+ speaker recognition corpus and the open-set speaker-identification benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.767045Z"},"links":{"cited_paper":"/paper/2407.11510","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:240b1e7d539307a4b196780adfeb1c0c3a5a4384c94137c2c7a1606d769015bf","observation_id":"90723b50-6955-4e15-aa8a-5229bc7d5a0b","resolution":{"observed_at":"2026-08-07T15:43:03.767045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-08T04:36:13.309903Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-07T15:43:03.878807Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.878807Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:e5421e4e670426fe28034d93c184abad6b0acb44fc4f9bf9a506249264580359","observation_id":"dc3d2ccd-9969-41dc-ac57-55fd0e06b23b","resolution":{"observed_at":"2026-08-07T15:43:03.878807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:06.226433Z","title":"Kespeech: An open source speech dataset of mandarin and its eight subdialects,","venue":null,"work_id":"e0d7c885-f97a-4d1d-bc28-bfc920108a7d","year":2021},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:03.938904Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:895215a9edddc64f119256eb7dc01cb7e460d02b5be2cb4030aa82197b7227a4","observation_id":"c7e3d097-71db-4f79-bc87-2ea03ec6a50e","resolution":{"observed_at":"2026-08-07T15:43:06.293656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15354","last_updated":"2023-09-25T02:36:41Z","snapshot_observed_at":"2026-08-07T07:23:53.931725Z","submitted_at":"2023-06-27T10:09:43Z","title":"3D-Speaker: A Large-Scale Multi-Device, Multi-Distance, and Multi-Dialect Corpus for Speech Representation Disentanglement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15354","snapshot_observed_at":"2026-08-07T15:43:04.029122Z","title":"3d-speaker: A large-scale multi-device, multi-distance, and multi-dialect cor- pus for speech representation disentanglement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.029122Z"},"links":{"cited_paper":"/paper/2306.15354","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:ca89272310b890d09b103be16f3c2c4ab87cf94b070d894a464a179f396580c2","observation_id":"5ad194ca-b72e-4f4d-9468-e213687d7f26","resolution":{"observed_at":"2026-08-07T15:43:04.029122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-07T15:43:04.140000Z","title":"Ecapa- tdnn: Emphasized channel attention, propagation and ag- gregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.140000Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:8bdcaa5c5a141f7dc65a50af2a86214b138091b1640529c87cfc56ea2469dde2","observation_id":"2fbc7da8-9942-4d95-b08a-e464e0796a9c","resolution":{"observed_at":"2026-08-07T15:43:04.140000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.219246Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.219246Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:f2d7f8667a5cf817b8e704164d1303016909c693d85acbbb2637104dcb634d9a","observation_id":"f9b28de0-ed4d-4341-9501-1ae12bebade2","resolution":{"observed_at":"2026-08-07T15:43:04.219246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.308158Z","title":"The ami meeting corpus,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.308158Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:f3b5e1febdc959c0627c12bcc26d9235f82c6312f20bfb32ddfc48068257a994","observation_id":"498eb297-5d96-4a18-9d4f-b1523a25db7b","resolution":{"observed_at":"2026-08-07T15:43:04.308158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.390574Z","title":"Lip-reading with densely connected temporal convolutional networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.390574Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:ad5b134ed94fe68adf5897d506eb1702f104cdd1cc1c120087a5ec4f0ade9010","observation_id":"49055ca4-5d30-4e6b-b90e-6adb66cce4ce","resolution":{"observed_at":"2026-08-07T15:43:04.390574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.485577Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.485577Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:3c5b9db9105effd4ecd340c0d5210a80e5f201b5d183c7ac0b43228643463334","observation_id":"ca19d67a-28fd-4b16-9564-edaf8e684aaf","resolution":{"observed_at":"2026-08-07T15:43:04.485577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.617021Z","title":"Wenetspeech: A 10000+ hours multi- domain mandarin corpus for speech recognition,","venue":null,"work_id":"f4d17a4b-074a-49c1-8c93-251a29a70ff8","year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.559893Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:e75cf342df9f609406c64a6143c4330e1afab2429b86868bbe10e0e4265245ba","observation_id":"6dbbfdd8-4a91-4c43-be47-b2a52ce12a48","resolution":{"observed_at":"2026-08-07T15:43:05.746106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13849","last_updated":"2025-06-21T06:43:49Z","snapshot_observed_at":"2026-07-06T19:53:34.670694Z","submitted_at":"2024-11-21T05:15:46Z","title":"Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13849","snapshot_observed_at":"2026-08-07T15:43:04.678989Z","title":"Sequence-to-sequence neural di- arization with automatic speaker detection and representation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.678989Z"},"links":{"cited_paper":"/paper/2411.13849","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:b6c426b3c472c87d50727d72bdf0920089daa7aea0d885705c414f175278dccc","observation_id":"a70e8cee-0bec-4546-b2c3-3b0c3e71d1fc","resolution":{"observed_at":"2026-08-07T15:43:04.678989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:04.846296Z","title":"Mossformer2: Com- bining transformer and rnn-free recurrent network for enhanced time-domain monaural speech separation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.846296Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:cbdabd8d8fa182746dbeceb44d687b1e1a3de5efb4bdfcafb89d36ab656afa79","observation_id":"909b7d81-34cb-44bd-b0dd-6df558509c42","resolution":{"observed_at":"2026-08-07T15:43:04.846296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T15:43:04.928529Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.928529Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:1213c49cac8ae0a6fc92ec14e1f00334e47c80012a9a2722523fe72332cde2ff","observation_id":"1494347b-02b1-43d7-9318-d5ff6fcb3771","resolution":{"observed_at":"2026-08-07T15:43:04.928529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:05.450556Z","title":"Generalization of multi-channel linear prediction methods for blind mimo impulse response short- ening,","venue":null,"work_id":"15be806a-36e3-4a3b-8429-ed73d8c2f4fb","year":2012},"citing_paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:05.021485Z"},"links":{"citing_paper":"/paper/2505.13971"},"observation_digest":"sha256:7c74965875e587842cb22442aa40be91fc078fbfa86b6effd4661c89de5fe5a3","observation_id":"fc4ac28f-13cd-4e27-8b80-0d5abb96a892","resolution":{"observed_at":"2026-08-07T15:43:05.514736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13971","last_updated":"2025-05-27T05:03:46Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T08:23:35.619235Z","submitted_at":"2025-05-20T06:11:51Z","title":"The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 6 inbound Pith citation observations for arXiv:2505.13971."}