{"as_of":"2026-08-08T03:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a5fc22c661940024279891456367256adf66536fa066832b264c1621e94befab","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:03:32.780424Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:59:42.926035Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":"2101.00390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-04T08:59:42.926035Z","title":"Voxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":"d8e92e18-fd4a-42ef-9af9-c0185e756bb8","year":2021},"citing_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-24T05:00:28.453838Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2312.11805"},"observation_digest":"sha256:e226ba3f46d0f05c9493a8acabcca83b5c5091123fdf1d9c5720912312d8f21f","observation_id":"b5f067a1-5f74-48e5-bc36-15b8f732aaea","resolution":{"observed_at":"2026-05-24T05:03:55.473790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":"2101.00390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-04T08:59:42.926035Z","title":"Voxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":"d8e92e18-fd4a-42ef-9af9-c0185e756bb8","year":2021},"citing_paper":{"arxiv_id":"2502.04230","last_updated":"2026-05-22T02:22:15Z","snapshot_observed_at":"2026-07-06T20:32:18.814472Z","submitted_at":"2025-02-06T17:15:08Z","title":"XAttnMark: Learning Robust Audio Watermarking with Cross-Attention","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-25T08:30:15.011210Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2502.04230"},"observation_digest":"sha256:f93fa7e905d6402fbfe5a7cdc0ce8e6e0e5ef0f6f91fd63990f02c4d52f2e4ee","observation_id":"df8b7a56-ea67-465b-8f34-2edfe29b78dc","resolution":{"observed_at":"2026-05-25T08:30:31.517132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":"2101.00390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-04T08:59:42.926035Z","title":"Voxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":"d8e92e18-fd4a-42ef-9af9-c0185e756bb8","year":2021},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:6b545da8240334b00f7ebea13ec292f7ff16689f4faa7c93dea56068a54e9afe","observation_id":"444d5cec-fedb-4c44-87c4-6ac9730a923b","resolution":{"observed_at":"2026-05-11T19:21:27.071481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-07T15:03:32.780424Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation.arXiv preprint arXiv:2101.00390, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16490","last_updated":"2025-05-25T10:12:09Z","snapshot_observed_at":"2026-08-07T18:41:12.547692Z","submitted_at":"2025-05-22T10:22:15Z","title":"HPP-Voice: A Large-Scale Evaluation of Speech Embeddings for Multi-Phenotypic Classification","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:32.780424Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2505.16490"},"observation_digest":"sha256:f5646a4b9f3b3553e07972f9d26a32379f7c18c76534965b59d6ca71edafe679","observation_id":"3cfacb16-af02-45e6-9163-d43e839a6056","resolution":{"observed_at":"2026-08-07T15:03:32.780424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-07T14:58:58.237399Z","title":"Preprint, arXiv:2101.00390","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:58.237399Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:3792b2bc65f58420d8130907adb618eb9722b2adac721646305cf3485883005d","observation_id":"ee506292-b81c-45b4-8312-f35493fea5df","resolution":{"observed_at":"2026-08-07T14:58:58.237399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-07T14:55:57.846781Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16972","last_updated":"2025-05-22T17:51:05Z","snapshot_observed_at":"2026-08-07T14:50:02.267494Z","submitted_at":"2025-05-22T17:51:05Z","title":"From Tens of Hours to Tens of Thousands: Scaling Back-Translation for Speech Recognition","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:57.846781Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2505.16972"},"observation_digest":"sha256:a2a6e740721e8297d19b97620e7866bb93d01f1b2652ec957bb69e246daf271d","observation_id":"b12b32fd-de54-4556-817b-b2c42d11dca1","resolution":{"observed_at":"2026-08-07T14:55:57.846781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-07T14:12:48.668479Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.668479Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:d2f63a7be88f3994fed910d8f9d36c245cd1b13d4ebf1805b3818c614978e9b0","observation_id":"fc9a8ab5-343b-4ba1-ae6c-dedcb0b7b62b","resolution":{"observed_at":"2026-08-07T14:12:48.668479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-07T11:02:26.212501Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03722","last_updated":"2025-06-04T08:53:40Z","snapshot_observed_at":"2026-08-07T23:49:51.662559Z","submitted_at":"2025-06-04T08:53:40Z","title":"MFLA: Monotonic Finite Look-ahead Attention for Streaming Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:02:26.212501Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2506.03722"},"observation_digest":"sha256:ff5402fc7d346e76360ba83d611e6aa930413293a61919bc26d71f87c6b7c274","observation_id":"62cf6209-dec3-431b-98bc-12855fdd7f48","resolution":{"observed_at":"2026-08-07T11:02:26.212501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-07T05:35:13.888662Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07659","last_updated":"2025-06-09T11:31:24Z","snapshot_observed_at":"2026-08-07T05:26:15.411856Z","submitted_at":"2025-06-09T11:31:24Z","title":"Unified Semi-Supervised Pipeline for Automatic Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:13.888662Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2506.07659"},"observation_digest":"sha256:81f05b25e8aab22299e249dd9a3e8279635ec755d5b48871412895a773bc4a3b","observation_id":"51c5bdbc-2ebc-4811-8a2f-a6b72e0b28e1","resolution":{"observed_at":"2026-08-07T05:35:13.888662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-06T23:34:09.173525Z","title":"Preprint, arXiv:2101.00390","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-06T23:28:50.074862Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:09.173525Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:8fc5b018940d7a8815831b8a164b2e2923254c0fef272727802dd81796c798d5","observation_id":"9d90560f-7ae2-47ac-a5cf-b99fa37eaee7","resolution":{"observed_at":"2026-08-06T23:34:09.173525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-06T18:33:18.489814Z","title":"V oxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07877","last_updated":"2025-08-01T20:13:43Z","snapshot_observed_at":"2026-08-07T19:11:17.494477Z","submitted_at":"2025-07-10T16:00:27Z","title":"Edge-ASR: Towards Low-Bit Quantization of Automatic Speech Recognition Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:18.489814Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2507.07877"},"observation_digest":"sha256:d2edaf4f5a8d07a0636728c0d10a09427b3d67ea99caedab990b13b85f7aa852","observation_id":"2e9d6ea3-8a1f-4ed8-8865-22e14f8480c2","resolution":{"observed_at":"2026-08-06T18:33:18.489814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":"2101.00390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-04T08:59:42.926035Z","title":"Voxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":"d8e92e18-fd4a-42ef-9af9-c0185e756bb8","year":2021},"citing_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-15T03:42:44.523919Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2507.08128"},"observation_digest":"sha256:6019e4b0c80c6fefcf6f2bc0a44b2ec0a157a8068e36e74a9a948f08043cfc86","observation_id":"3ece12cd-30a7-43f6-b941-35aafc10cc84","resolution":{"observed_at":"2026-05-15T03:42:45.248930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-06T18:14:08.902551Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08768","last_updated":"2025-07-11T17:27:11Z","snapshot_observed_at":"2026-08-06T18:06:58.265245Z","submitted_at":"2025-07-11T17:27:11Z","title":"On Barriers to Archival Audio Processing","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:14:08.902551Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2507.08768"},"observation_digest":"sha256:f667e789767665c7d215192e7509eabd30d1dd39211a7146c7cd00d3530ba2c1","observation_id":"6d9537f6-57df-417c-a1d3-c98e3510fb15","resolution":{"observed_at":"2026-08-06T18:14:08.902551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-06T15:13:09.439905Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16456","last_updated":"2025-07-22T10:59:21Z","snapshot_observed_at":"2026-08-07T05:01:03.648076Z","submitted_at":"2025-07-22T10:59:21Z","title":"An approach to measuring the performance of Automatic Speech Recognition (ASR) models in the context of Large Language Model (LLM) powered applications","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:13:09.439905Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2507.16456"},"observation_digest":"sha256:2df8698f7083e75fb0ee51c087e5392d81e5fe8974584aee0315d6794227813b","observation_id":"6404bd70-32fa-466e-b654-406b91370c41","resolution":{"observed_at":"2026-08-06T15:13:09.439905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-05T12:07:21.412121Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01939","last_updated":"2025-09-02T04:20:12Z","snapshot_observed_at":"2026-08-07T18:39:10.295579Z","submitted_at":"2025-09-02T04:20:12Z","title":"Group Relative Policy Optimization for Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:07:21.412121Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2509.01939"},"observation_digest":"sha256:7f98a94d44e7c4d1d79311368062413c05878b7a1ff23d54d850b662edf69060","observation_id":"bf6f6e49-c096-41c8-86db-03287d382039","resolution":{"observed_at":"2026-08-05T12:07:21.412121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-05T13:53:25.480535Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04473","last_updated":"2025-08-29T22:38:16Z","snapshot_observed_at":"2026-08-08T03:18:24.744014Z","submitted_at":"2025-08-29T22:38:16Z","title":"SpeechLLM: Unified Speech and Language Model for Enhanced Multi-Task Understanding in Low Resource Settings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:53:25.480535Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2509.04473"},"observation_digest":"sha256:0007f1050984303d6eb669ddb5be394c7ef3a4da6de385a836a46db7b3ee787c","observation_id":"1d292078-0891-4d23-92c2-4d347df25a3b","resolution":{"observed_at":"2026-08-05T13:53:25.480535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-05T05:02:16.274239Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05849","last_updated":"2025-09-13T18:31:56Z","snapshot_observed_at":"2026-08-05T05:02:12.046320Z","submitted_at":"2025-09-06T22:10:24Z","title":"From perception to production: how acoustic invariance facilitates articulatory learning in a self-supervised vocal imitation model","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T05:02:16.274239Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2509.05849"},"observation_digest":"sha256:c4592712aaf702fd2ce0a1ea4fdf6aaf2b27654bb36c5fa5080cc6bd240da990","observation_id":"caa0a545-4f09-45b7-a604-0ee6e3a1e41a","resolution":{"observed_at":"2026-08-05T05:02:16.274239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":"2101.00390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-04T08:59:42.926035Z","title":"Voxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":"d8e92e18-fd4a-42ef-9af9-c0185e756bb8","year":2021},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-02T12:47:50.534468Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:4049728fc7372fad90b706d5097a5c1b7f8bf5e65d04a0790f67eac103239e20","observation_id":"cda344ad-35fd-40b0-8bde-87d3c6790e7e","resolution":{"observed_at":"2026-05-18T13:01:24.405536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-04T10:17:43.934752Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-07T19:36:01.762818Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.934752Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:f9e38acd12aa5a26796dcfb93119e5b7ee39906d4e760982310674ff65b59f09","observation_id":"512e650d-05d0-4566-8218-f216c51451e2","resolution":{"observed_at":"2026-08-04T10:17:43.934752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-03T12:02:02.010823Z","title":"Voxpopuli: A large-scale multi- lingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-06T01:59:30.134013Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T12:02:02.010823Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:3134475223f004abc587b23b293b1bb6cb4df20a3839567a0db7935753d00293","observation_id":"9f150e90-e3a9-48ec-90b8-7a5747de2ada","resolution":{"observed_at":"2026-08-03T12:02:02.010823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-15T00:03:31.986628Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.09725","last_updated":"2026-07-09T13:30:49Z","snapshot_observed_at":"2026-08-07T12:27:46.774534Z","submitted_at":"2026-03-10T14:32:12Z","title":"A Semi-spontaneous Dutch Speech Dataset for Speech Enhancement and Speech Recognition","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-15T00:03:31.986628Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2603.09725"},"observation_digest":"sha256:fcf3365b1aaba4b2cfe72dcfd5b7b59fd7c728ba1d16a9cb8839537453d054cf","observation_id":"21093ffe-41f4-445d-8d76-c11f59339e69","resolution":{"observed_at":"2026-07-15T00:03:31.986628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":"2101.00390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-04T08:59:42.926035Z","title":"Voxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":"d8e92e18-fd4a-42ef-9af9-c0185e756bb8","year":2021},"citing_paper":{"arxiv_id":"2604.22817","last_updated":"2026-04-14T20:56:24Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-14T20:56:24Z","title":"In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T13:25:50.524448Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2604.22817"},"observation_digest":"sha256:693762957ae2c1005797555b7fb92ec1147a541bed9bf94f30fb52a579cba971","observation_id":"fa3ec273-1c9f-4c28-a4d4-a5f4b4cada9b","resolution":{"observed_at":"2026-05-10T13:35:26.707984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":"2101.00390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-04T08:59:42.926035Z","title":"Voxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":"d8e92e18-fd4a-42ef-9af9-c0185e756bb8","year":2021},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-02T05:36:23.979419Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:1fcba8ebf80710a2602b758589390af3860dc1badf671c2d8fc65ba0e8b45fef","observation_id":"c1ff7800-3715-43f2-8791-515dfcb4e63f","resolution":{"observed_at":"2026-05-11T04:50:55.995475Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":"2101.00390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-04T08:59:42.926035Z","title":"Voxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":"d8e92e18-fd4a-42ef-9af9-c0185e756bb8","year":2021},"citing_paper":{"arxiv_id":"2605.20830","last_updated":"2026-05-20T07:21:36Z","snapshot_observed_at":"2026-08-02T05:58:18.404966Z","submitted_at":"2026-05-20T07:21:36Z","title":"Raon-OpenTTS: Open Models and Data for Robust Text-to-Speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T02:32:26.122526Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2605.20830"},"observation_digest":"sha256:e976f5cf6f74657ae56b0bf4e4d69baf30d22045acf8313e579781092a5b11af","observation_id":"d8f15238-338e-4b4a-bcd5-70bc8f4a5c2d","resolution":{"observed_at":"2026-05-21T02:33:55.398729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":"2101.00390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-04T08:59:42.926035Z","title":"Voxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":"d8e92e18-fd4a-42ef-9af9-c0185e756bb8","year":2021},"citing_paper":{"arxiv_id":"2605.30899","last_updated":"2026-05-29T06:33:36Z","snapshot_observed_at":"2026-08-04T13:19:05.357869Z","submitted_at":"2026-05-29T06:33:36Z","title":"A Unified and Reproducible Experimentation Framework for Speech Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:16.428207Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2605.30899"},"observation_digest":"sha256:c32a63c9ccd13ca7894324f39dc0d5341711b1ce30ca376cc496b4ca16bb689e","observation_id":"afe61cb0-722c-4aac-b777-01fe72d86fb1","resolution":{"observed_at":"2026-07-01T20:16:12.228406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":"2101.00390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-04T08:59:42.926035Z","title":"Voxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":"d8e92e18-fd4a-42ef-9af9-c0185e756bb8","year":2021},"citing_paper":{"arxiv_id":"2606.13121","last_updated":"2026-06-11T09:49:46Z","snapshot_observed_at":"2026-07-06T23:51:55.044440Z","submitted_at":"2026-06-11T09:49:46Z","title":"NaturalFlow: Reducing Disruptive Pauses for Natural Speech Flow in Simultaneous Speech-to-Speech Translation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T06:59:29.020530Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2606.13121"},"observation_digest":"sha256:cd17e8846e5b418803a13e7d4962b63cee7e046359407e522bdb31b1007b79af","observation_id":"50d2ac01-4d92-4ee5-8c71-936d4a543597","resolution":{"observed_at":"2026-07-03T14:38:29.117785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":"2101.00390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-07-04T08:59:42.926035Z","title":"Voxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation","venue":null,"work_id":"d8e92e18-fd4a-42ef-9af9-c0185e756bb8","year":2021},"citing_paper":{"arxiv_id":"2606.22473","last_updated":"2026-06-21T12:33:44Z","snapshot_observed_at":"2026-07-06T23:57:18.596834Z","submitted_at":"2026-06-21T12:33:44Z","title":"Interleaved Speech Language Models Latently Work In Text","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T10:41:19.777779Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2606.22473"},"observation_digest":"sha256:efa26ed7266e2db49298b5145e2c46c98bde75d5cbdaf5c625f8fa9771d7535e","observation_id":"796dd2b9-b815-40d1-9b73-63d8316d7d75","resolution":{"observed_at":"2026-07-04T08:59:42.927597Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-01T11:43:06.517800Z","title":"arXiv preprint arXiv:2101.00390 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19810","last_updated":"2026-07-22T06:42:20Z","snapshot_observed_at":"2026-08-07T23:49:52.327639Z","submitted_at":"2026-07-22T06:42:20Z","title":"SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision","version":1},"reference_index":169,"source":"arxiv_source","source_observed_at":"2026-08-01T11:43:06.517800Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2607.19810"},"observation_digest":"sha256:f79a4984eb14488969fdeedb8ca1d220267ce1e3011b682cf0f62852a2042710","observation_id":"2611f189-4158-47dd-b79a-961d6fd9cc4a","resolution":{"observed_at":"2026-08-01T11:43:06.517800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2101.00390/citation-record","integrity":"/paper/2101.00390/integrity","json":"/paper/2101.00390/citation-record.json","paper":"/paper/2101.00390"},"outbound":[],"paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2101.00390."}