{"as_of":"2026-08-08T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f4edc89d6f0bf98d80258c7afd6d780792a8aefd93407061ac2a460ca0becd39","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:10:00.192129Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11064/citation-record","integrity":"/paper/2506.11064/integrity","json":"/paper/2506.11064/citation-record.json","paper":"/paper/2506.11064"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:13.372063Z","title":"Robust speech recog- nition via large-scale weak supervision,","venue":null,"work_id":"d252c5a6-4dde-402e-9a05-c2619814a790","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:54.535544Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:ff1f03020399122e523a59c4c49231de2f0122af147a51ed5fc8e065f83ef5fc","observation_id":"795184c4-9f4c-4280-b093-7aad874d0be9","resolution":{"observed_at":"2026-08-07T12:10:13.476004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:13.212224Z","title":"Improving neural biasing for contextual speech recognition by early context injection and text perturbation,","venue":null,"work_id":"74caa0ab-e843-4ee1-a825-656fa1791ba3","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:54.606799Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:764d03ce72029ace26dc105da8dcb2ddbe98a31065de3551b2b58a76c23b4788","observation_id":"befd6656-ab63-4123-b91c-fdb025c445de","resolution":{"observed_at":"2026-08-07T12:10:13.298437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:13.051041Z","title":"Multi-modal video sum- marization based on two-stage fusion of audio, visual, and recognized text information,","venue":null,"work_id":"bc986cf6-5cec-4fb6-8359-3e27943e2ac9","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:54.685814Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:5c6a266eac4e204a91a6a92f2b8bd9b725bd6718f8fb7d239607012a01c5c693","observation_id":"02b2d899-25dd-4727-8d3e-af9fec6917d1","resolution":{"observed_at":"2026-08-07T12:10:13.122617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.835157Z","title":"In-context learning for few-shot nested named entity recognition,","venue":null,"work_id":"f4fe34e8-d676-4f70-87b6-a629a7a00af1","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:54.807340Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:a554760e4e624efbb93ce511a268dcb1c28b1063495f8be93eef7ef8f305f1ef","observation_id":"17bd42fa-a2ed-44b3-8334-fe95ba27b8ce","resolution":{"observed_at":"2026-08-07T12:10:12.931173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.600404Z","title":"MF-AED-AEC: Speech emotion recognition by leveraging multimodal fusion, ASR error detection, and ASR error correction,","venue":null,"work_id":"a22c1888-21e1-48a7-8cd9-69252719700a","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:54.879097Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:470eb8f468de5dd74c71556a8e4f667a4a20dfab03b2567a6bfb352f4d2a2d2f","observation_id":"2736ff4e-81a3-4d60-9b8a-7d594796d1e1","resolution":{"observed_at":"2026-08-07T12:10:12.706390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.462589Z","title":"Tree-constrained pointer generator with graph neural network encodings for contextual speech recognition,","venue":null,"work_id":"c8251e0f-6d7e-4985-9560-1d6b83acb651","year":2022},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:54.989920Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:f1fe1f461ebfdd94c6f2de64fab38286d863d46f1937d772a5952dc106907f24","observation_id":"4cc8b090-3aac-4e9e-8c33-4a84c6b18652","resolution":{"observed_at":"2026-08-07T12:10:12.513934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:55.053460Z","title":"MaLa-ASR: Multimedia-assisted LLM-based ASR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.053460Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:070986eb6afa02d0f67f84ffa7febd8db2a381ce6703579b062f1f97e1fee131","observation_id":"a8a60f8e-9764-4364-8119-5398b2c59625","resolution":{"observed_at":"2026-08-07T12:09:55.053460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.315366Z","title":"Contextual speech recognition in end- to-end neural network systems using beam search","venue":null,"work_id":"fc943edb-01d4-4dd8-99f3-f0d711ed7ae6","year":2018},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.166690Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:9081cd853d749ea91fe1dc4fbad5d4dbdfa56e7352759a73322ef4bc3704738e","observation_id":"e60ec4d0-4368-4047-af1c-86504a958918","resolution":{"observed_at":"2026-08-07T12:10:12.371221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.115080Z","title":"Deep shallow fusion for RNN-T personalization,","venue":null,"work_id":"d48987aa-c6d6-4303-a10c-01c2c8ec69e9","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.276976Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:3ee64845d032725eddedcb125188d4123557c5d7d0114411130d7a3065bb3ec9","observation_id":"9a6815ff-2714-4889-ae35-2b666f096cc3","resolution":{"observed_at":"2026-08-07T12:10:12.214946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.941637Z","title":"Fac- torized neural transducer for efficient language model adaptation,","venue":null,"work_id":"80659d0c-37ae-4530-96ed-3f6b2e9bc15a","year":2022},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.362025Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:f1d6e60759c3bc289ddafb980203ce599acfb25d60120c44816f47ff3cf3271a","observation_id":"e5bde053-7127-4c71-a8c9-422bdf04ef2f","resolution":{"observed_at":"2026-08-07T12:10:12.001988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.767359Z","title":"Tree-constrained pointer generator for end-to-end contextual speech recog- nition,","venue":null,"work_id":"bb5e9663-8117-4372-9f81-f1d1bb8812a3","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.478617Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:8eed77bcc839ac657946a2049bbb8f37e78b5914095e6b0c8dcbc2a010bec29c","observation_id":"f14c9184-6399-4a9f-889a-3ccd8c9b3638","resolution":{"observed_at":"2026-08-07T12:10:11.852805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.538110Z","title":"Graph neural networks for contextual ASR with the tree-constrained pointer generator,","venue":null,"work_id":"41af5d61-5f7a-4b7e-a7b7-4b50ada938b5","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.567078Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:d3a0400cc9fce678cabdb5ea45d50a8d8e99524cfd51a5b36f87d3a66b854a72","observation_id":"305e3948-682a-495e-bff0-d3c88a480ccc","resolution":{"observed_at":"2026-08-07T12:10:11.635358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.342184Z","title":"Deep context: end-to-end contextual speech recognition,","venue":null,"work_id":"f8b73732-58ee-4f45-a5e7-7c619d61356f","year":2018},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.649689Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:debd48b61fb06297cddebdfbfb434f2efd1dd155c13a74034781b29927994628","observation_id":"7e5ba78e-f86e-419c-8043-1eb7ab052706","resolution":{"observed_at":"2026-08-07T12:10:11.402200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.150868Z","title":"In- stant one-shot word-learning for context-specific neu- ral sequence-to-sequence speech recognition,","venue":null,"work_id":"a689fb1b-d6e6-4732-ba63-dcf913c29789","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.738916Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:8082e89b28ae680df5f002b5f36ee5b57c88ad8de5c03a2936c49abe2dfa290a","observation_id":"18a7c00d-a718-4c7d-9b93-c69a37359616","resolution":{"observed_at":"2026-08-07T12:10:11.238213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-07-06T18:42:05.670928Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-08-07T12:09:55.809973Z","title":"Seed-ASR: Understanding diverse speech and contexts with LLM- based speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.809973Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:01e345b534cf54b321943bd8cdfde6f2c61d09955345c17392b20890eaff4ece","observation_id":"ba4234d8-d03c-420c-8bc8-b5ebc8443421","resolution":{"observed_at":"2026-08-07T12:09:55.809973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-06T09:11:01.697195Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-07T12:09:55.881758Z","title":"An embarrassingly simple approach for LLM with strong ASR capacity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.881758Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:e6a776aa8ea2621b1ce1d291636d403336c09957e0bf429e7c2b9fcfc03d36cd","observation_id":"917b0f81-305f-4f0d-a635-503c76013c37","resolution":{"observed_at":"2026-08-07T12:09:55.881758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.972088Z","title":"PATCorrect: Non-autoregressive phoneme-augmented transformer for ASR error correction,","venue":null,"work_id":"c1a52243-4cec-4958-bbcc-9b9946b4392d","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.963474Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:217aaae4c5417ff21de3f6e175d718edeaee685b942f82472944490b33a51907","observation_id":"5007eac8-be5f-4d3f-bcc1-58a2a1e1a547","resolution":{"observed_at":"2026-08-07T12:10:11.048365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.821856Z","title":"Towards contextual spelling correction for customization of end-to-end speech recognition systems,","venue":null,"work_id":"9779cb6a-1430-4308-8f86-4794aa885f16","year":2022},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.029694Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:3d086a342b00e98b4e47f81169f5db494a356d36d5e90a73494b878018cfcbc8","observation_id":"c64b3490-c5af-4d02-9dd9-d02c4e85965e","resolution":{"observed_at":"2026-08-07T12:10:10.905612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.642066Z","title":"ASR error correction with constrained decoding on operation prediction,","venue":null,"work_id":"54c57636-7013-4a20-adf5-eb65e7433c15","year":2022},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.120735Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:0951fc09c67ecfde10bbf2e955b784d01236ef466104796a0a9fc2b65edff921","observation_id":"63675498-1a5d-425b-9ba6-7ce5793ea438","resolution":{"observed_at":"2026-08-07T12:10:10.732161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.419693Z","title":"Crossmodal ASR error correction with discrete speech units,","venue":null,"work_id":"9fcd59cf-870b-469b-a6d0-6741a1644546","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.235752Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:cbc8837734e34ed6f2e4f06565025403660b1d544aee767b7c01e5e0ef03b1e6","observation_id":"6b305f5c-6fb4-4e82-bf83-22cc9e91e26d","resolution":{"observed_at":"2026-08-07T12:10:10.515885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:56.309353Z","title":"ED-CEC: Improving rare word recognition using ASR postprocessing based on error detection and context-aware error correction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.309353Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:a4fd738b1ca71050e8aea586d7759334facabfefc4941c6385671562cc1347e0","observation_id":"be5203e1-5c66-4c82-b2da-693cbf8ecb7d","resolution":{"observed_at":"2026-08-07T12:09:56.309353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.164663Z","title":"ASR error correction with dual-channel self-supervised learning,","venue":null,"work_id":"bcb5333c-ad3c-47dc-b3a2-024a2f2cfc35","year":2022},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.392563Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:95b8ba0d3afc7fdee7d105cf1137147142e51ac42096170b79a65461b50c8b7d","observation_id":"e33e5840-d7e4-471e-8e2c-70c77f0703e1","resolution":{"observed_at":"2026-08-07T12:10:10.295592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:09.940061Z","title":"Enhancing recognition of rare words in ASR through error detection and context- aware error correction,","venue":null,"work_id":"53d82d6d-4437-4a4d-aa42-b9a7848a2562","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.450865Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:0f1b94c21985c204b5b8a7d64af0412e1510fcd17c246ee91615df36cacab12c","observation_id":"171d958c-11f7-499f-a350-f65ff468b93f","resolution":{"observed_at":"2026-08-07T12:10:10.042072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:09.770282Z","title":"Pronunciation guided copy and correction model for ASR error correction,","venue":null,"work_id":"9cd6082c-acc9-4574-8b5b-d01d4284ab74","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.507396Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:8b2d927d8115cbf40176f0a715ee39bf78f07fbe7da43fb5a66614aa2b91ad7a","observation_id":"128aa5aa-9cd5-499e-a144-464796e04fb2","resolution":{"observed_at":"2026-08-07T12:10:09.854351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:09.607495Z","title":"Hyporadise: An open baseline for generative speech recognition with large language models,","venue":null,"work_id":"3a4f7c79-3829-493e-86d3-a44dc6c13457","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.576657Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:0b17e844cf98a89bed6ff742e070b8f454269dcd18cee7d20a9ffc81d8b4c786","observation_id":"759e06a5-14fe-407c-b277-1a6f8e12f3ea","resolution":{"observed_at":"2026-08-07T12:10:09.675944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:09.403203Z","title":"Generative speech recognition error correction with large language models and task-activating prompting,","venue":null,"work_id":"46c310e7-11ad-4fb0-a8b1-6e145168735b","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.669039Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:c080798420e078fa825014427badc8261e2e45db4d0c92a3ecb2880c3b4d153b","observation_id":"334b07ab-3ad2-4cf7-ab71-524361572dce","resolution":{"observed_at":"2026-08-07T12:10:09.475503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:09.196958Z","title":"Large language model based generative error correction: A challenge and baselines for speech recognition, speaker tagging, and emotion recognition,","venue":null,"work_id":"f7c9a1f5-ddbf-4454-8ab9-675bf7cb90cb","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.727413Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:eac958bc9b9b8e7b65b8f9f4505059de3b1befb22e18567b539633e098d68770","observation_id":"c90d9aca-8435-40ad-9fff-4b954195a4aa","resolution":{"observed_at":"2026-08-07T12:10:09.259523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:09.088438Z","title":"Large language models are efficient learners of noise-robust speech recognition,","venue":null,"work_id":"ac14bca3-ea42-42e0-a4f7-e5e9f363ee9c","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.779737Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:3f4d732dceea23c4493cc792c631d2827f9f7b6648a171c31ab18eea319733e6","observation_id":"b47b8166-9b18-45d8-a995-eb967d3b6174","resolution":{"observed_at":"2026-08-07T12:10:09.153363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.879393Z","title":"Revise, reason, and recognize: LLM-based emotion recognition via emotion-specific prompts and ASR error correction,","venue":null,"work_id":"8908a72d-b214-4419-b4cd-9d01c0b2bf37","year":2025},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.846069Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:c3c40af27568cb441c6f4b0ce6136fb4f17289e36df9caa73292a7f3877b2fbb","observation_id":"a5c5d98f-ead1-4ecb-9a94-525b193f3fc6","resolution":{"observed_at":"2026-08-07T12:10:08.986466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.732672Z","title":"ASR error cor- rection using large language models,","venue":null,"work_id":"936a1659-48f7-49ec-90ec-e6f84992e38d","year":2025},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.907624Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:46668700ebf679014baac6f3b6212c77e87f62d0a2771c250609111ba9561a09","observation_id":"b6fd0513-432d-4f9c-9dd1-26ed7026b28c","resolution":{"observed_at":"2026-08-07T12:10:08.787156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.529248Z","title":"Bringing contextual information to Google speech recognition","venue":null,"work_id":"d0c9ebb2-0f1c-4097-997f-226aab180caf","year":2015},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.995198Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:b5679fe9e4a0b96fdbe142fea77e7ca1c9a16e6d4ad63cfe6e23da9577784720","observation_id":"263b21d7-a261-42a1-85ed-60a6ff20b07b","resolution":{"observed_at":"2026-08-07T12:10:08.606086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.366887Z","title":"Personalized speech recognition on mobile devices,","venue":null,"work_id":"5b314506-4a5e-44e9-b940-8ef17513ef79","year":2016},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.072870Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:9a7c93b67332c9daaadaebe70ec8b46a2b9ba393130abd7b529d27486dc40576","observation_id":"6942ae83-7a25-4b46-8207-9a8a3d89f54d","resolution":{"observed_at":"2026-08-07T12:10:08.455790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.180823Z","title":"Shallow-fusion end-to-end contex- tual biasing","venue":null,"work_id":"9a414d37-2717-41a7-b702-d51dcf376cc0","year":2019},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.138781Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:ff9774141c70b00db43930c4579f24389803d09fb34261da97516e9d0acc6488","observation_id":"05d110ab-6f19-4eb2-8fa2-1c14d7f7577d","resolution":{"observed_at":"2026-08-07T12:10:08.271125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.041914Z","title":"Im- proving ASR contextual biasing with guided attention,","venue":null,"work_id":"2379516e-b1c7-41bf-aa74-968ebe03634b","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.197498Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:66493a8d81a5cb1962da733488ab402e2e17054380db30af9f41d102944ff51c","observation_id":"2635b13b-620e-4749-928a-e68e5dd2a5ae","resolution":{"observed_at":"2026-08-07T12:10:08.107981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:07.873172Z","title":"NAM+: Towards scalable end-to-end contextual biasing for adaptive ASR,","venue":null,"work_id":"14362644-2af0-4318-bc21-67ad56b4a250","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.286122Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:943fa1092e953174c04f3f6e530ebecaa3618d712cce5c1a1bbc95c9935c8d40","observation_id":"ba8632d8-e878-43ac-9d8a-c466a43c2c1b","resolution":{"observed_at":"2026-08-07T12:10:07.965694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:07.696240Z","title":"Robust JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, AUGUST 2021 16 acoustic and semantic contextual biasing in neural trans- ducers for speech recognition,","venue":null,"work_id":"6e836863-4cee-4cbe-93be-5d7c074c2111","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.354191Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:8c9154c8cc7e0feee068a5b96804953905f59cf469cf13d2c5049676bc2f18b9","observation_id":"7c5e6537-bada-4715-885a-e10be976b10f","resolution":{"observed_at":"2026-08-07T12:10:07.756030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:07.541577Z","title":"Contextualized streaming end-to-end speech recognition with trie-based deep biasing and shallow fusion,","venue":null,"work_id":"269ff309-b68c-488e-b3fa-679020214cb1","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.412402Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:592ff4655aa9b19f5ba1d9d193a707952d3cea9b1d92b32d97a446d29c9424fc","observation_id":"b48b89d5-985c-4cef-9207-3fead8decb60","resolution":{"observed_at":"2026-08-07T12:10:07.622967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:07.382876Z","title":"Joint grapheme and phoneme embeddings for contextual end-to-end ASR,","venue":null,"work_id":"331ac129-88de-4ec1-966c-0b99698a3c8a","year":2019},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.442711Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:a90dd75330d2523b1470b76e486d57e4ce3f75c8cf26c3370dfaa008a8cd6904","observation_id":"e541cadc-a635-483e-9890-f9297642cfc4","resolution":{"observed_at":"2026-08-07T12:10:07.467810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:07.165951Z","title":"Phoebe: Pronunciation-aware contextualization for end-to-end speech recognition,","venue":null,"work_id":"985897d9-44e0-4d4e-a69c-8a112fe542bb","year":2019},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.502307Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:376febfca82b8797f51c4617a74910894af75f5b33e2c8c79a46dcb61ddb09e3","observation_id":"eecf21bb-f178-4ba4-b139-4d5c4c2fac48","resolution":{"observed_at":"2026-08-07T12:10:07.288103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:06.951080Z","title":"Context-aware transformer transducer for speech recognition,","venue":null,"work_id":"44914d1b-b969-4e33-bee7-2629f9804d1f","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.555725Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:56a02e42143cf865c933d4b4c153dd006bbefe65a833dff684be4cd95b3929a5","observation_id":"b9020583-7c6b-416b-8bce-39d069e9390b","resolution":{"observed_at":"2026-08-07T12:10:07.046443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:06.793747Z","title":"Contextual adapters for personalized speech recognition in neural transducers,","venue":null,"work_id":"73d19d29-8088-4f4f-919c-8c6771ed9c5f","year":2022},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.621783Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:7c2b12a182a5f6c9b4104da02633a7d58ed1f3a1e7572a5ce8d2e5cf6b457017","observation_id":"30c7dd88-902f-4fed-946f-a645a16e5442","resolution":{"observed_at":"2026-08-07T12:10:06.862201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:06.599427Z","title":"Contextualized automatic speech recog- nition with attention-based bias phrase boosted beam search,","venue":null,"work_id":"955db3e0-1d51-4cc3-9fa9-f38ef495c67d","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.673300Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:b82e45fb2032d90b6ac439fdd03fc77af580c844bcb5357953bed51fa297e28f","observation_id":"431bb925-2adc-49c5-ae84-556ef5458f26","resolution":{"observed_at":"2026-08-07T12:10:06.695090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:06.465068Z","title":"LCB-Net: Long- context biasing for audio-visual speech recognition,","venue":null,"work_id":"8d9b9d40-ffdf-4815-a955-8c2005bf55cf","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.731673Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:826248d8ffe74d336c4784f12d24f0b63fe7944a289dc5b650416b94de59e11b","observation_id":"78d49a82-cf8a-4e4a-85fa-1ba5c671a9df","resolution":{"observed_at":"2026-08-07T12:10:06.533002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:05.197094Z","title":"A light-weight contextual spelling correction model for customizing transducer-based speech recognition systems,","venue":null,"work_id":"847ce928-0913-493b-8d51-8b5482fa435b","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.791870Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:10dbf34167c209fd30f0f79ba0527ba4843cbb2ee65acdc8a5da83aec81720ee","observation_id":"e44ffb73-6b3e-4f5b-8374-c0c7c25a1e53","resolution":{"observed_at":"2026-08-07T12:10:06.398668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:04.256487Z","title":"Contextual modeling for document-level ASR error correction,","venue":null,"work_id":"b542359e-ac22-45b9-b0e7-5ba50573f882","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.795723Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:fa9225b476b4b38acd34b8d2a12dd229bbda7e1a94020d38f548bf7612ea642d","observation_id":"a1b80ee5-6db5-409b-bc8e-d33d508b9a38","resolution":{"observed_at":"2026-08-07T12:10:04.605985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-07T12:09:57.799976Z","title":"Google’s neural machine translation system: Bridging the gap between human and machine transla- tion,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.799976Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:e598cec16996f7a0233c774374aa448fb6cdf8db6ed7a81563c69c034f187c7c","observation_id":"d26de918-d19e-4c7a-8f2c-bf47120f68b4","resolution":{"observed_at":"2026-08-07T12:09:57.799976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:03.803359Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"3cd78330-7da3-4211-bb44-51484a6384a9","year":2019},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.876538Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:ac8d4b2947e493ebf2c0f4644070bdd0216db8132302f4c3b42aeafc1893a930","observation_id":"773f2ee5-dacf-4b3e-91fe-bdf226f3796f","resolution":{"observed_at":"2026-08-07T12:10:03.916007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:03.487562Z","title":"Attention is all you need,","venue":null,"work_id":"5a0a5179-9659-4f1a-93dd-030f0ab978dd","year":2017},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.066167Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:215f2e6fbd3b2d423c21835b01c4ae1b4d2dee50d95ed7b62161aa73735d9b08","observation_id":"385c6b1b-fcbb-42d5-bff4-045d0616ef01","resolution":{"observed_at":"2026-08-07T12:10:03.622423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:03.191374Z","title":"XPhoneBERT: A pre-trained multilingual model for phoneme representations for text-to-speech,","venue":null,"work_id":"3e18c009-abc1-4c2d-8be8-04d585b779f4","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.223113Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:d2526ac92fb2bc8e6300246f4abfd37491a43afaed8e4b5b9bb9a82002b27349","observation_id":"030290e0-6c3b-4079-b45a-7c094466f19d","resolution":{"observed_at":"2026-08-07T12:10:03.335176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:02.901684Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":"996be152-c6ca-49f9-ba52-953baa5b8ced","year":2015},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.384702Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:9a527458eb27bc4590fe5b39c226635963ad9587148692b31625952c9580d504","observation_id":"6f7da346-6b58-467a-a0b3-15291e0272a3","resolution":{"observed_at":"2026-08-07T12:10:03.067905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:02.693388Z","title":"Phoneme- BERT: Joint language modelling of phoneme sequence and ASR transcript,","venue":null,"work_id":"daff0938-423b-44a2-840b-a549167c5d38","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.558760Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:756edd005c949fdb8e9ca585a8ec7df8485e368180c3525dc0cb01f4e2b16937","observation_id":"c0eb8ff4-1f65-4906-9c2a-1360b27dfcfa","resolution":{"observed_at":"2026-08-07T12:10:02.804668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:02.504666Z","title":"Listen, attend and spell: A neural net- work for large vocabulary conversational speech recog- nition,","venue":null,"work_id":"a82a0227-2b40-41c4-b55f-ec8fd8e9f168","year":2016},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.700119Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:9016acda2c78fe81e59005401828dd2bc6351bc3f54188840746b219b01684ed","observation_id":"bcb3941c-9dce-4b3b-af25-d81af6aaa558","resolution":{"observed_at":"2026-08-07T12:10:02.619361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:02.275947Z","title":"Learning ASR-robust contextualized embeddings for spoken language under- standing,","venue":null,"work_id":"0d419233-b616-45f2-8cc5-5a8ea0f9321c","year":2020},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.868801Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:aabdc52428232390dbfe6fef26ba01d7c29b5c19551efdca9e3483457acc468b","observation_id":"2d9c8ce2-f19e-4ca8-8baf-5c660b662a1b","resolution":{"observed_at":"2026-08-07T12:10:02.377713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:01.969517Z","title":"The Kaldi speech recognition toolkit,","venue":null,"work_id":"618bd359-a31f-4da3-9c12-def7a81266a5","year":2011},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.995741Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:8d9f784826118d76622faa508891fbad0158fd94ba1a08439286132ae6bfd91e","observation_id":"65194e8d-7309-4d15-a140-a8cbd90c6919","resolution":{"observed_at":"2026-08-07T12:10:02.108163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:59.139644Z","title":"LibriSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.139644Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:e72523e3574bdc856d2ec0cf91a176156c2bc452ebea2b25328768256acb1685","observation_id":"fc3a365c-4a72-46c8-a135-8ff4744ddc62","resolution":{"observed_at":"2026-08-07T12:09:59.139644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:01.587588Z","title":"WeNet: Pro- duction oriented streaming and non-streaming end-to-end speech recognition toolkit,","venue":null,"work_id":"dc70763c-aa11-45dc-8970-c9d537def2b7","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.273949Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:c3f5353f7e9c7ca62d7098782a8001febf9e255ac6590df88d27e5a66978ca0f","observation_id":"397deb37-405e-47a3-b1e4-2282af85d61a","resolution":{"observed_at":"2026-08-07T12:10:01.801836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:01.297819Z","title":"End-to-end named entity recognition from english speech,","venue":null,"work_id":"d4089a38-cc5d-4c71-9128-4beb382b803a","year":2020},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.392515Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:eb3bbf43dffabe295ce4c5de0eb029e3cfc2350c97ca0397f20e4847ee1c68ec","observation_id":"15503f58-4c14-4e7e-a39e-29ac6b2c62c2","resolution":{"observed_at":"2026-08-07T12:10:01.470161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:01.069732Z","title":"ESPnet: End-to-end speech processing toolkit,","venue":null,"work_id":"a3629989-d37e-47b9-a63f-16e14f77b9ab","year":2018},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.460713Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:9ded4cd8c9a669667660d3f63da35278bb119f93d445205d799020918500dfab","observation_id":"67445069-ac20-4ac8-9038-34aea226c645","resolution":{"observed_at":"2026-08-07T12:10:01.183635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:00.886090Z","title":"Multimodal corpus analysis of autoblog 2020: lecture videos in machine learning,","venue":null,"work_id":"01dee486-cd25-4ea1-9ab8-96596221c291","year":2020},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.548179Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:d930b19aed4c286b0260579f71fe1718033a2bb909cdd5c1bfb1e9eefce6f340","observation_id":"80b05360-a624-4d6c-a359-7af441e8cdaa","resolution":{"observed_at":"2026-08-07T12:10:00.960115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-07T12:09:59.651665Z","title":"SpeechBrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.651665Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:e059a654c5363c69e28748b91d1ecbdf90dd535483303096fd8afbd84ac65a64","observation_id":"8f580526-bd99-4d0e-a2fa-353338163af2","resolution":{"observed_at":"2026-08-07T12:09:59.651665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:00.720640Z","title":"BART based semantic correction for Mandarin auto- matic speech recognition system,","venue":null,"work_id":"6412b208-b742-4130-93cb-5c7ff7e96563","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.777769Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:ca6cd53336d13c122695d98bda1e3227369317d995638d8beba6035643d4cf03","observation_id":"131cc46b-f282-42ad-b172-f0a9b886f988","resolution":{"observed_at":"2026-08-07T12:10:00.796798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.13002","last_updated":"2020-10-28T04:47:59Z","snapshot_observed_at":"2026-08-05T14:49:27.919722Z","submitted_at":"2020-10-24T23:15:43Z","title":"Pre-trained Summarization Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.13002","snapshot_observed_at":"2026-08-07T12:09:59.880897Z","title":"Pre-trained summarization distillation,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.880897Z"},"links":{"cited_paper":"/paper/2010.13002","citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:da4d909b89a4625bf41044f22f0479a54afda380266fda5385aef4c5a7535c21","observation_id":"02294ade-0622-47e8-8e3f-00f6aaaadeef","resolution":{"observed_at":"2026-08-07T12:09:59.880897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:00.553383Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":"f9335c96-1c0f-464e-bfb5-6183f5ddbcb8","year":2019},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.982285Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:1181e597fb77d6b1f1efa0cfcc29b4a7e8e173f2775b579d946e2c0945ca2d12","observation_id":"13c16aed-3391-465f-8d53-3a9ef908e7f3","resolution":{"observed_at":"2026-08-07T12:10:00.634610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:00.368375Z","title":"Whispering LLaMa: A cross-modal generative error correction framework for speech recognition,","venue":null,"work_id":"28feb9f9-7152-487f-b422-d708512aa741","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:10:00.093377Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:4b7165d919c1fdb794e602fe133846391a9e293cc8f55ca75d484e294b9970d5","observation_id":"1d311449-8541-4fe4-99b9-1a802f4c38f2","resolution":{"observed_at":"2026-08-07T12:10:00.422771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:10:00.192129Z","title":"LLaMa: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:10:00.192129Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:7f39f27b00cbafe4c4769ef053e61f05374dabda49e19bee9ad456d1f491a408","observation_id":"eaf7e625-a27d-4df6-aa27-bf3f2c2a7460","resolution":{"observed_at":"2026-08-07T12:10:00.192129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T13:59:00.615437Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":56},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2506.11064."}