{"as_of":"2026-08-08T12:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f07d6ad71af5d82a54c184b09cd6b68f03fb20c8e74eb73266f05cd68235b8b9","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:12:49.357205Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:12:46.355892Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:28:39.508010Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19774","snapshot_observed_at":"2026-08-07T14:12:46.355892Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:46.355892Z"},"links":{"cited_paper":"/paper/2505.19774","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:a53013496a6a9893486935452fde6dfc632b6c9e72525180d478e8d240666c7d","observation_id":"9e950d8d-1520-491e-aa3a-3cb394e00e08","resolution":{"observed_at":"2026-08-07T14:12:46.355892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19774","snapshot_observed_at":"2026-08-05T12:07:21.427323Z","title":"Durep: Dual-mode speech representation learning via asr-aware distillation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01939","last_updated":"2025-09-02T04:20:12Z","snapshot_observed_at":"2026-08-07T18:39:10.295579Z","submitted_at":"2025-09-02T04:20:12Z","title":"Group Relative Policy Optimization for Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:07:21.427323Z"},"links":{"cited_paper":"/paper/2505.19774","citing_paper":"/paper/2509.01939"},"observation_digest":"sha256:5037a379c9eb0bb49a7c1ed541b5c9f2b816bac5d584be69d516cd5d02315b70","observation_id":"4bbfd3a9-aead-4908-a0a2-b5d7e635a8a1","resolution":{"observed_at":"2026-08-05T12:07:21.427323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"cited_work":{"arxiv_id":"2505.19774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19774","snapshot_observed_at":"2026-07-03T16:28:39.508010Z","title":"Durep: Dual-mode speech representation learning via asr-aware distillation,","venue":null,"work_id":"f82648a3-0788-40e9-a82e-547bebab04ab","year":2025},"citing_paper":{"arxiv_id":"2606.13544","last_updated":"2026-06-26T09:33:27Z","snapshot_observed_at":"2026-07-06T23:52:18.996096Z","submitted_at":"2026-06-11T16:27:45Z","title":"Adaptive Turn-Taking for Real-time Multi-Party Voice Agents","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T05:32:27.371597Z"},"links":{"cited_paper":"/paper/2505.19774","citing_paper":"/paper/2606.13544"},"observation_digest":"sha256:2dbaaf8b882b28cf6f9d9aece7ea3ffe1b97ea1805cd62dbe095962076e40f13","observation_id":"582576fd-6365-410b-8a1b-82e0ab308188","resolution":{"observed_at":"2026-07-03T16:28:39.509589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"cited_work":{"arxiv_id":"2505.19774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19774","snapshot_observed_at":"2026-07-03T16:28:39.508010Z","title":"Durep: Dual-mode speech representation learning via asr-aware distillation,","venue":null,"work_id":"f82648a3-0788-40e9-a82e-547bebab04ab","year":2025},"citing_paper":{"arxiv_id":"2606.13544","last_updated":"2026-06-26T09:33:27Z","snapshot_observed_at":"2026-07-06T23:52:18.996096Z","submitted_at":"2026-06-11T16:27:45Z","title":"Adaptive Turn-Taking for Real-time Multi-Party Voice Agents","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T05:01:44.202712Z"},"links":{"cited_paper":"/paper/2505.19774","citing_paper":"/paper/2606.13544"},"observation_digest":"sha256:9f5bd9d00a09c444de369b938d8945d9b7f10f174cc86d281948696211dd7217","observation_id":"8e31b141-02f7-419c-9087-a3b0b05247c2","resolution":{"observed_at":"2026-06-29T18:43:51.419791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19774/citation-record","integrity":"/paper/2505.19774/integrity","json":"/paper/2505.19774/citation-record.json","paper":"/paper/2505.19774"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:53.030239Z","title":"Full-context encoders [1, 2], leveraging entire speech utterances, offer superior accuracy but higher latency, making them ideal for offline use","venue":null,"work_id":"854e3323-771e-42cf-9808-f9070c7faf29","year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:46.192370Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:0bf11194292a29f077606a5c74777904bdcce4c0c2588a5cb07775008b64e429","observation_id":"5f25726a-38b9-46a3-aa95-c855e7e20be6","resolution":{"observed_at":"2026-08-07T14:12:53.104993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19774","snapshot_observed_at":"2026-08-07T14:12:46.355892Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:46.355892Z"},"links":{"cited_paper":"/paper/2505.19774","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:a53013496a6a9893486935452fde6dfc632b6c9e72525180d478e8d240666c7d","observation_id":"9e950d8d-1520-491e-aa3a-3cb394e00e08","resolution":{"observed_at":"2026-08-07T14:12:46.355892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:52.612286Z","title":null,"venue":null,"work_id":"cc7df91c-614f-4c40-8f26-c8732f918146","year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:46.467017Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:43b933cfa452662ed46f23b0bbe35151eaa9cbead1b6a44409f7b39215623108","observation_id":"a6ad7272-62b5-4be4-9a9a-02d1a43c21e6","resolution":{"observed_at":"2026-08-07T14:12:52.685483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:52.209380Z","title":"Results Table 1 presents a comparative analysis of the dual-mode en- coder and single-mode baseline encoders across full-context and streaming scenarios, in ASR tasks","venue":null,"work_id":"70d0dec2-345c-45d9-bf0b-386c7fbe3b6f","year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:46.646277Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:e7f1d022d6eb47aaf22d55384e11671c35ba6b1336fea4cd5ecd4e3ae7ca6b76","observation_id":"fa9dcbb8-7061-43e1-b826-bdaec77172bb","resolution":{"observed_at":"2026-08-07T14:12:52.286979Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:52.406399Z","title":"Due to these variations, absolute WERs reported after our SUPERB bench- marking are higher than those reported in the original works","venue":null,"work_id":"7c19c9c5-9dd4-4eae-b872-16c3b602a92f","year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:46.552005Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:a91eebc8eef298f1f05ec109f216412199de940a869470926e1f8ecd2a33e313","observation_id":"46293429-1243-40a3-9b44-805d29587b3a","resolution":{"observed_at":"2026-08-07T14:12:52.496675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:52.790493Z","title":null,"venue":null,"work_id":"15af9d20-b3be-4398-9db7-3b41ceeb43a0","year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:46.274896Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:61f915d2b71d5a84678e41bbdacb8531fee5d5d8aef22b026ea20202ed562698","observation_id":"2f177c02-655e-4476-ab67-569e5eed50a5","resolution":{"observed_at":"2026-08-07T14:12:52.908471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:52.033263Z","title":"Results Table 4 compares the performance of the DuRep-2B encoder in two inference modes with open-source encoders on ASR and non-ASR tasks, evaluated using SUPERB framework (3.4)","venue":null,"work_id":"f339ffdc-eec0-4759-b824-1d5f8520e7a9","year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:46.744428Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:fb24d7067da9d4d1e1e8e235d6381cdcbf20d1344382b8a39b787260282323ea","observation_id":"c65c6e3a-f562-467d-81ce-1e2a83a8e978","resolution":{"observed_at":"2026-08-07T14:12:52.127133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:51.751892Z","title":"In ASR-SUPERB evaluations, on average, the DuRep-200M encoder outperforms baselines by 13.06% in streaming and 10.42% in non-streaming mode","venue":null,"work_id":"b57fadd6-1033-4474-8ef9-c482f4ea61cf","year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:46.835187Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:5d4e5e3af69b1b6b5a5af7b0655a7c19b6a31f3fa8806edc36fac659c870d33e","observation_id":"ff259256-d9db-4d11-929e-1baa37b58f5e","resolution":{"observed_at":"2026-08-07T14:12:51.897019Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:51.549707Z","title":null,"venue":null,"work_id":"9fba1296-6518-494f-bea3-2725ab2bfb1d","year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:46.895063Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:376bf7e2829cee866375f7cd05bbded94ecb7c6794e0177ddc2a1343e6062f79","observation_id":"3df5a67f-bfa2-4c30-b26b-c66d3e4dc616","resolution":{"observed_at":"2026-08-07T14:12:51.660143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:46.963664Z","title":"Google usm: Scaling automatic speech recognition beyond 100 languages,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:46.963664Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:df4e5883b45fcb86ddc6c6d1616d27551c0fa239ae792d2ed62ff8b785b8f7fc","observation_id":"c9700196-b019-4ea0-b376-8035a5b3ad6b","resolution":{"observed_at":"2026-08-07T14:12:46.963664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.108528Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.108528Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:4e66180e874bbac485309af3d79f75cb77663cc05275d63a6878445815e7e1d7","observation_id":"ec2afa29-f28f-4268-8c15-77ae428a0d6f","resolution":{"observed_at":"2026-08-07T14:12:48.108528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:12:47.158251Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.158251Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:be6f81fafe301c9423131717e5b982ab214d246af5bd19fb9d5c291cc582ed44","observation_id":"ac4fef8f-9040-40f2-8b58-b96e78ba18bf","resolution":{"observed_at":"2026-08-07T14:12:47.158251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.06030","last_updated":"2021-01-27T17:56:46Z","snapshot_observed_at":"2026-07-06T10:03:46.733926Z","submitted_at":"2020-10-12T21:12:56Z","title":"Dual-mode ASR: Unify and Improve Streaming ASR with Full-context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.06030","snapshot_observed_at":"2026-08-07T14:12:47.243261Z","title":"Dual-mode asr: Unify and improve streaming asr with full-context modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.243261Z"},"links":{"cited_paper":"/paper/2010.06030","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:6197e48cd4ed10e04ae55c8329bd4852d0f23296d7857642c8e6048a1d92e542","observation_id":"7b8ab252-ca3f-4248-ad46-fc0a3ba2ac4a","resolution":{"observed_at":"2026-08-07T14:12:47.243261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11157","last_updated":"2022-06-22T15:04:15Z","snapshot_observed_at":"2026-07-06T13:23:37.082077Z","submitted_at":"2022-06-22T15:04:15Z","title":"Conformer with dual-mode chunked attention for joint online and offline ASR","version":1},"cited_work":{"arxiv_id":"2206.11157","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.11157","snapshot_observed_at":"2026-08-07T14:12:50.109707Z","title":"Conformer with dual-mode chunked attention for joint online and offline ASR","venue":"eess.AS","work_id":"ebf0df4a-c7e0-4e29-914d-4589b9fb8706","year":2022},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.355685Z"},"links":{"cited_paper":"/paper/2206.11157","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:7c9930c94189bca41073e19ba9ba2487f8324a92f1534e227c1023226058012d","observation_id":"81e526fa-4163-487f-9b74-bf211c4000bb","resolution":{"observed_at":"2026-08-07T14:12:50.153372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:51.378813Z","title":"Multi- mode transformer transducer with stochastic future context,","venue":null,"work_id":"32437bcc-bac0-4b84-80c5-f998d8617148","year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.466237Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:cb75698be915606e4ca12afea5bff3ee7459cd9773230ac9a26c6b0e7e2244b4","observation_id":"4aebe4a4-8b17-490a-ae73-0d5d352b39a3","resolution":{"observed_at":"2026-08-07T14:12:51.451479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:51.027269Z","title":"Fleurs: Few-shot learning evaluation of universal representations of speech,","venue":null,"work_id":"8122eb53-e117-4196-9f49-bfc05c09fce4","year":2022},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.584229Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:03043b550f80fb14c2c7bb879b1875a17cc0090354ce6f1475ba0fc7a676a7af","observation_id":"5b58ca95-c45e-4e83-8170-4a4517a1083b","resolution":{"observed_at":"2026-08-07T14:12:51.072372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01438","last_updated":"2023-04-18T09:59:52Z","snapshot_observed_at":"2026-07-06T14:13:46.912823Z","submitted_at":"2022-11-02T19:14:02Z","title":"Variable Attention Masking for Configurable Transformer Transducer Speech Recognition","version":2},"cited_work":{"arxiv_id":"2211.01438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.01438","snapshot_observed_at":"2026-08-07T14:12:49.862139Z","title":"Variable Attention Masking for Configurable Transformer Transducer Speech Recognition","venue":"eess.AS","work_id":"e6c1ce1d-1225-45f2-babd-fefacbdbd71c","year":2022},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.679297Z"},"links":{"cited_paper":"/paper/2211.01438","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:76a8c1237d4075c9fdb4fca8a88739ac47b3d96fb371db876bd7d8c69acdfba5","observation_id":"9acf3d35-c4ac-457a-8387-83306a72b0c6","resolution":{"observed_at":"2026-08-07T14:12:49.920805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:51.251803Z","title":"Sequence transduction with recurrent neural networks,","venue":null,"work_id":"92db90d5-172e-4fc9-8330-1dc616a5278f","year":2012},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.760230Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:4f765631faa61330a988053f05c1a2cf82b1c073637b3d73c9e8b2bd29d8b33b","observation_id":"862a48ce-cd21-4cf8-9386-2c06d30700c2","resolution":{"observed_at":"2026-08-07T14:12:51.319686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-07-06T11:05:55.984799Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-07T14:12:47.829556Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.829556Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:445e5030257c4f0e9931aa712ef2deca8096113d76aced1a62edbfb11efbc84c","observation_id":"c822dc6b-1ea6-4b31-a86a-eea374679c94","resolution":{"observed_at":"2026-08-07T14:12:47.829556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01855","last_updated":"2022-06-29T21:35:41Z","snapshot_observed_at":"2026-07-06T12:34:17.702891Z","submitted_at":"2022-02-03T21:29:04Z","title":"Self-supervised Learning with Random-projection Quantizer for Speech Recognition","version":2},"cited_work":{"arxiv_id":"2202.01855","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.01855","snapshot_observed_at":"2026-08-07T14:12:49.672351Z","title":"Self-supervised Learning with Random-projection Quantizer for Speech Recognition","venue":"cs.CL","work_id":"32c86ab6-261b-4bec-899e-5cd5697ccbe4","year":2022},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.911681Z"},"links":{"cited_paper":"/paper/2202.01855","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:c255a07966bdfd5228abb76b0eb6cf92e6016bbab0507987b19088fe315d8d63","observation_id":"534ac630-f760-4521-9d3a-06d5baefddae","resolution":{"observed_at":"2026-08-07T14:12:49.761320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:51.129869Z","title":"Universal-1: Robust and accurate multi- lingual speech-to-text,","venue":null,"work_id":"c84e0a9b-d888-4a57-9822-64860df8d806","year":2024},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.032670Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:d39138ea37e4df2c82072d1f148d8d66591dfce958c4b3008bc36f2f122ef6de","observation_id":"157c9368-a37c-426c-ae3f-e7a5d50f0181","resolution":{"observed_at":"2026-08-07T14:12:51.197138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10615","last_updated":"2025-02-24T18:06:55Z","snapshot_observed_at":"2026-08-04T15:29:25.040229Z","submitted_at":"2023-05-18T00:01:27Z","title":"ML-SUPERB: Multilingual Speech Universal PERformance Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10615","snapshot_observed_at":"2026-08-07T14:12:49.072445Z","title":"Ml-superb: Multilingual speech universal performance benchmark,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:49.072445Z"},"links":{"cited_paper":"/paper/2305.10615","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:b12c52e4a39e8236285492c8afcc3ba0be3fb649c382f42bc110746d5633cfa8","observation_id":"b7da4468-3076-44dc-a9eb-cc06b1140fcc","resolution":{"observed_at":"2026-08-07T14:12:49.072445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.177512Z","title":"Lib- rispeech: An asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.177512Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:1f5a7839450ee6bcb222f27960dbd504b4ddd90fc25ac2e6ec23f8bb407596db","observation_id":"a09b4471-d3be-4e13-9274-7b338103663e","resolution":{"observed_at":"2026-08-07T14:12:48.177512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.292894Z","title":"Mls: A large-scale multilingual dataset for speech research,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.292894Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:87aad9a87398395d96d3b1d95b188761f628681269b7b4db548cd884862814b9","observation_id":"7cca1858-305a-43de-a932-0019aa2902fb","resolution":{"observed_at":"2026-08-07T14:12:48.292894Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T14:12:48.384304Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.384304Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:2a7d748448e85c13e197d4fa98a1a02060044721928fc663c747583d14004acf","observation_id":"8907619b-305c-480c-bbdf-d9ac1a0a2de7","resolution":{"observed_at":"2026-08-07T14:12:48.384304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-07T14:12:48.463964Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.463964Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:d7c966bea91c2b17751ba37bcfdf41809640dd91c1bec75e42449ffe50a97469","observation_id":"52b343b8-f89f-43d4-9dfa-e35a1fa2c00c","resolution":{"observed_at":"2026-08-07T14:12:48.463964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:50.272921Z","title":"On the utility of self-supervised mod- els for prosody-related tasks,","venue":null,"work_id":"1c30684a-957e-4ce4-aada-37ef10e3429a","year":2023},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:49.357205Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:1c05c4b87d9d0d02a86aa1476d56d48568692cd894362aa0c38988f1f12cf79c","observation_id":"02ec53c7-2e9d-4eb7-ba40-45b105b4b1a3","resolution":{"observed_at":"2026-08-07T14:12:50.352190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-05T19:58:56.227907Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-07T14:12:48.668479Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.668479Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:d2f63a7be88f3994fed910d8f9d36c245cd1b13d4ebf1805b3818c614978e9b0","observation_id":"fc9a8ab5-343b-4ba1-ae6c-dedcb0b7b62b","resolution":{"observed_at":"2026-08-07T14:12:48.668479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:50.872051Z","title":"free public domain audiobooks,","venue":null,"work_id":"c01bfa16-47f7-4c52-86dd-bf6f5d1a47e4","year":2024},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.737679Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:13aa1000e52d2909b812ae4214bdadb800105abb4ad91baf70b62bb4a64d6a0e","observation_id":"8c545bf0-d54b-4e6d-a7c6-dcd66f3bcc2b","resolution":{"observed_at":"2026-08-07T14:12:50.931336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.785451Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.785451Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:dedcc45a5fb43ba70aa1629d8128bbf2b43bcfe92077abb9598757137a05093f","observation_id":"3dc4be5b-c3cf-4eb8-bb71-2b8f6cede795","resolution":{"observed_at":"2026-08-07T14:12:48.785451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.979925Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.979925Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:2c82c4a8283450e28d941bcecc295d569e38a75db3d8a8deb423b01825e4457a","observation_id":"91fb33ab-6728-4d4c-9828-3681a6d691d6","resolution":{"observed_at":"2026-08-07T14:12:48.979925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:50.637262Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":"6a5abcdd-f63b-4443-8787-9c8050ae699b","year":2019},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:49.032602Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:295f1efa65e2b41e497ed68fc83da4c3dd079b6353d306f64d1ec4d17482df92","observation_id":"4abe35ea-4d8e-4cca-845f-33de1adffd47","resolution":{"observed_at":"2026-08-07T14:12:50.723614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:50.446998Z","title":"Msp-podcast corpus: A large naturalistic speech emotional dataset,","venue":null,"work_id":"6e5093bf-2074-407c-bd68-c2538ebfc736","year":2024},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:49.107373Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:534473ff26baf06306fac74ac9d85d39d720274d1f6296fb50d060905915c0e0","observation_id":"4690a66b-005f-4d52-9384-106eafc4bcdc","resolution":{"observed_at":"2026-08-07T14:12:50.534911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-07T05:13:16.889179Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-08-07T14:12:49.162149Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:49.162149Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:252160e0aaf81e4cd782ce5c86bcc7cfa2d19bc5e53a7797180879b00541a808","observation_id":"98f3f17c-256a-433b-8ca4-77f34dc87fbf","resolution":{"observed_at":"2026-08-07T14:12:49.162149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06371","last_updated":"2024-11-21T10:45:39Z","snapshot_observed_at":"2026-07-06T18:28:12.010251Z","submitted_at":"2024-06-10T15:32:42Z","title":"mHuBERT-147: A Compact Multilingual HuBERT Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06371","snapshot_observed_at":"2026-08-07T14:12:49.231627Z","title":"mhubert-147: A compact multilingual hubert model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:49.231627Z"},"links":{"cited_paper":"/paper/2406.06371","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:41f791dbd4b765f32b15a079436ca44958a6fbfba3abb60d13dfcf1751108678","observation_id":"2a313904-5856-45fa-90f8-15d6b4658691","resolution":{"observed_at":"2026-08-07T14:12:49.231627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:49.296912Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:49.296912Z"},"links":{"citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:9682b2520d1abfa35262a96117692fdc98ec7b3f1049fcb74fd28b56fb0adc26","observation_id":"f2af490b-06d7-4ba1-83c2-e87bfd0522b4","resolution":{"observed_at":"2026-08-07T14:12:49.296912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-07-06T09:20:55.416309Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T14:12:48.881846Z","title":"Available: https://arxiv.org/abs/2005.08100","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:48.881846Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:dafad3c69c2ddbaeb4e935163ac9be383a0294fd8d3edb256cfa1709f6162e89","observation_id":"1e9dd8c2-89ec-41fb-9003-a684f8c85455","resolution":{"observed_at":"2026-08-07T14:12:48.881846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09760","last_updated":"2021-06-17T18:42:11Z","snapshot_observed_at":"2026-07-06T11:20:29.182280Z","submitted_at":"2021-06-17T18:42:11Z","title":"Multi-mode Transformer Transducer with Stochastic Future Context","version":1},"cited_work":{"arxiv_id":"2106.09760","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.09760","snapshot_observed_at":"2026-08-07T14:12:50.001160Z","title":"Multi-mode Transformer Transducer with Stochastic Future Context","venue":"eess.AS","work_id":"44596f8a-daec-4c06-92f7-8451c4cd2e63","year":2021},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.570835Z"},"links":{"cited_paper":"/paper/2106.09760","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:9ee4a0a878e89ac04c2678274613784c1da43be804c9be6b51ba1490118f45f1","observation_id":"95b117fd-89c3-4d1b-b4e6-a7450b5d471a","resolution":{"observed_at":"2026-08-07T14:12:50.045674Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T14:12:47.058460Z","title":"Available: https://arxiv.org/abs/2303.01037","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:47.058460Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2505.19774"},"observation_digest":"sha256:4831120a69a717e1a57c29fa6442928d45e1bb1eb9625e81552ce6bb1f0b91e9","observation_id":"1a5185df-5743-4224-b270-77f4de0e01cf","resolution":{"observed_at":"2026-08-07T14:12:47.058460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19774","last_updated":"2025-05-26T09:57:59Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T14:04:12.637882Z","submitted_at":"2025-05-26T09:57:59Z","title":"DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":3,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":21,"verified_exact":3,"verified_fuzzy":11},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 4 inbound Pith citation observations for arXiv:2505.19774."}