{"as_of":"2026-08-04T09:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:39c27b181645b0cad6ed8521d60943d00bb8022b4171928cf7ab3553c6041b32","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T18:06:47.859998Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:57:11.349967Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02782","snapshot_observed_at":"2026-08-01T16:57:11.349967Z","title":"When audio-language models fail to leverage mul- timodal context for dysarthric speech recognition,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17812","last_updated":"2026-07-20T10:59:15Z","snapshot_observed_at":"2026-08-01T16:57:08.740216Z","submitted_at":"2026-07-20T10:59:15Z","title":"ESCUCHA: A Spanish Speech Benchmark for Heterogeneous Acoustic Conditions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T16:57:11.349967Z"},"links":{"cited_paper":"/paper/2605.02782","citing_paper":"/paper/2607.17812"},"observation_digest":"sha256:73314421eaea6f9989b46fbac5afb9027de1c5006da4bb50c8b199fab99bf575","observation_id":"475bb423-9c3c-4c9b-aff9-f39783c5f9f6","resolution":{"observed_at":"2026-08-01T16:57:11.349967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.02782/citation-record","integrity":"/paper/2605.02782/integrity","json":"/paper/2605.02782/citation-record.json","paper":"/paper/2605.02782"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:43.494382Z","title":"Attention is All you Need , url =","venue":null,"work_id":"fa4d7178-75f8-4139-9b39-41030a2917db","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:40b189ff6c7a6b30d570550fbd7ae100a00a4cc0968387c40ca9214800a6b5f6","observation_id":"48dd6110-208d-40dd-822c-182dc72dcd16","resolution":{"observed_at":"2026-05-26T05:51:46.854601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:cfb5d2a17e010369e6ad471c65b6350188f784331e594a1134d7f005fbef7a2d","observation_id":"abfbf2bf-15ea-4e16-bd20-bb0be9f09530","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"3d0cffc3-6bf0-4aba-98d5-9bdf6ddc79c5","year":2024},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:835bd2f1c13b087fc0591583480e5ea4394d9bab76cab63863eaf372cbd632fd","observation_id":"25f871f0-514e-4a1d-b2f9-725f1bf5a208","resolution":{"observed_at":"2026-05-26T05:51:46.843242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:24:28.355271Z","title":"2022 , eprint=","venue":null,"work_id":"ad4aaf4b-08d9-470e-a494-e9e235804375","year":2022},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:d2e4c6d22e04d623b23fb28cb15bd46038c5c18627dcd80364657a2dff21b754","observation_id":"36730354-62dc-4052-bb4d-7221d63a623e","resolution":{"observed_at":"2026-05-26T05:51:46.846544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:01:40.116378Z","title":"2025 , eprint=","venue":null,"work_id":"7d865d23-e54b-417a-9927-62d06c9e3ce6","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:372e9c95eefb93bf0a76107bae4f733e97e4cc409a21e83b81fe67b8d53a1db9","observation_id":"382eb0ea-8551-47ea-aca8-ec0f3a8e9594","resolution":{"observed_at":"2026-05-26T05:51:46.835612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:23:43.352707Z","title":"2024 , eprint=","venue":null,"work_id":"a2fe15cd-a520-413c-b29e-a7183c7f33a8","year":2024},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:265e89ef5bae70d9b23f41a035741389fb92da48b75a7fb1d5fead9a9d530f45","observation_id":"ef4927ab-c9a5-46fd-925a-068d7e2ed7d7","resolution":{"observed_at":"2026-05-26T05:51:46.839378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2008-480","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Huang and Kenneth Watkin and Simone Frame , year =","venue":null,"work_id":"0a73e349-2678-455e-a581-79ae30be97e2","year":2008},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:ef6938445971600dc228e1ce002647c2764b2961bbd31b25e8c4a3ff5c8905e4","observation_id":"a8570081-f8b5-49f8-a4c0-77433598c369","resolution":{"observed_at":"2026-05-08T18:08:53.429906Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The TORGO database of acoustic and articulatory speech from speakers with dysarthria , volume =","venue":null,"work_id":"364b765f-d802-402a-97be-c9757d718536","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:1a9cc16bdaefcb70f91e25a7dd8236a68f0dc8dffe5cb393ecb11004b780519e","observation_id":"04cb6bed-f215-41a4-911b-333432346655","resolution":{"observed_at":"2026-05-26T05:51:46.850173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"f4495322-4026-448e-af67-11e0fca2d904","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:8b302d2cd0c9b56afd46272d69921b5e860a23e93083dece18685e36f561b92b","observation_id":"9eee9828-d0d9-42c1-b5a3-2afd7d957b40","resolution":{"observed_at":"2026-05-26T05:51:46.859162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-07-10T12:57:07.586760Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:bbff250658a6a4236d2695a68a13d6c521762c259a90ed88a26bac5f71288f0d","observation_id":"00b9c6d1-0fe8-46fc-8ab1-067e2e28de5c","resolution":{"observed_at":"2026-05-08T18:08:53.438480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"2ab3cacf-c11e-41b7-a982-2585b017aefb","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:90fd0ff526bc6752df999ee7ff6264925351ac74b64c29d8c1331d0aa7ffbd26","observation_id":"1e592c9d-a193-465e-ac09-909bf9770593","resolution":{"observed_at":"2026-05-26T05:51:46.875307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01027","last_updated":"2021-09-08T04:12:36Z","snapshot_observed_at":"2026-07-06T10:56:01.047350Z","submitted_at":"2021-04-02T12:53:15Z","title":"Robust wav2vec 2.0: Analyzing Domain Shift in Self-Supervised Pre-Training","version":2},"cited_work":{"arxiv_id":"2104.01027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.01027","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2104.01027 , year=","venue":null,"work_id":"fa4bdf2c-94e8-4197-ab68-ee0f965f7476","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2104.01027","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:a38899f39db0c0f8e8febf25c4d36192d88e1d79169bf1494a5b06ff38368a70","observation_id":"5f66ad36-d3be-400e-82e4-f5463f295cbe","resolution":{"observed_at":"2026-05-09T06:45:44.665734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-07-10T12:57:07.670593Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:2a98f5538fc58f5d8f61856e511dcd8a12c35b55dbc1c592676f193c0c967826","observation_id":"cfffa3e2-59ab-4fe8-8c71-e4ff17edcb33","resolution":{"observed_at":"2026-05-11T02:14:45.520303Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:2c7aafe7db2d9c53333a6677c0e6081bf8601afba1ca6b06357fa771e48f803e","observation_id":"cc47f93b-d4b6-46d3-98cc-71af1ef3e089","resolution":{"observed_at":"2026-05-11T00:20:38.220353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:e21bdc5261b9fd38f3b7c2583e2c26827635be2949c3d6b544679b74e3eda93f","observation_id":"b09c780d-ef32-4bd3-835d-1fb4239e4ed6","resolution":{"observed_at":"2026-05-13T13:59:09.287362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2e8ecffd-841c-4395-8f33-25221648db77","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:6b70647fd64d7079f61d60a1d3927257b1909691520f1a175bd89ab532233677","observation_id":"1f382364-325a-42ce-b87c-474eeecb3c28","resolution":{"observed_at":"2026-05-26T05:51:46.867064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"b119dcda-e0af-4561-8bbb-f3678ae2cc61","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:82c10c78c74a0e416eeafbd51fceb0cfc386094bf65ff6157de2dbaf9f8bf21c","observation_id":"afc141da-f4c4-4e2a-b833-c8411c26ee84","resolution":{"observed_at":"2026-05-26T05:51:46.870905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , howpublished=","venue":null,"work_id":"9388cd5a-7c47-437c-b80a-e4de8ad1121d","year":2026},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:e40329b5d7eceeadffbc63711eab51229e0003db9f460ca112f83c0007d8142b","observation_id":"759082b8-cc24-4121-bb31-9339ad7052b4","resolution":{"observed_at":"2026-05-26T05:51:46.808050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"b4006b9e-257c-48c9-84f8-24122f6a13d6","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:e39ac396375b89d8aae43a36340c868271d3d8cc448dfcc224a25a3b83ddf5ad","observation_id":"815abc3d-fa9b-4526-a1cb-69c235784603","resolution":{"observed_at":"2026-05-26T05:51:46.820714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-07-06T22:30:31.933240Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":"2509.18154","doi":"10.48550/arxiv.2509.18154","metadata_source":"pith","pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","venue":"cs.LG","work_id":"21d4b019-63d0-49e5-b51b-350ef4783709","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:ed2ef055928722ad197be0f98115c9815a177cd170380c07e5114e5cb4ff9602","observation_id":"9e2681ed-8247-4c3e-9b71-7ab2d1ea266f","resolution":{"observed_at":"2026-05-15T17:07:27.685083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:18.923957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:18.923957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , eprint=","venue":null,"work_id":"80a63d91-530c-40c2-8e01-ebd72b107e8b","year":2026},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:47626e8307a7af9e960d38e939c07581af5b597b197256d5761a67cc210427a7","observation_id":"0606d955-6152-4192-92aa-d46fb9b50092","resolution":{"observed_at":"2026-05-26T05:51:46.827925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"56cb175d-2ee8-4d18-a6be-74f802482371","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:38ccf9e944e49d994fb07ac280a65ac53b47875302b0d5b1c1effd86b2ea032c","observation_id":"a69bc087-7e50-403c-b22f-74aaddf284c1","resolution":{"observed_at":"2026-05-26T05:51:46.831903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"0bceb993-9434-409e-9b6c-82feeaa31c4f","year":2023},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:7011c750004222c6b37833214b2829731a67aa13de5a9914283eefd6fcc9e97e","observation_id":"17fb27cc-669d-4ee4-8bf8-e2a22b41866e","resolution":{"observed_at":"2026-05-26T05:51:46.800656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"743bac57-9d79-4137-94ad-19ce76c92e08","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:63bf07770f7401e4341a36dc470261505a83b225818485eb755004136dbf6c5c","observation_id":"8494eeaa-22d6-4b7f-a522-ee7c528f3cf9","resolution":{"observed_at":"2026-05-26T05:51:46.789546Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:37:47.847372Z","title":"2020 , eprint=","venue":null,"work_id":"f08d1287-d312-42b6-ad4b-5e5b86442250","year":2020},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:d7e68679d6d9363d437e5cccd6b9f28094b396ac7926c51746201e2a11ffa603","observation_id":"a3f07603-28fe-4459-8fc2-99edfeb344cc","resolution":{"observed_at":"2026-05-26T05:51:46.781921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:37:47.152657Z","title":"2019 , eprint=","venue":null,"work_id":"4c41a8dc-7f3a-4093-96ed-9cb29b926433","year":2019},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:0efb80a3fa8269b14cc8bd71f1691220b0b79449c64ccc55f2abbfc6cf6fd769","observation_id":"3138e4ef-d2fa-4e0f-affc-18745287b4e0","resolution":{"observed_at":"2026-05-26T05:51:46.778031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"40f8a687-1135-40f5-91b4-43a8d73e41f6","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:5f495362a8420493623f1bf2bab1a45abd03321746cba74e6e70a6fb25745864","observation_id":"f819bf0d-ead0-479e-af11-d0ace543000a","resolution":{"observed_at":"2026-05-26T05:51:46.769333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"ce65e02c-5b4e-43c1-b7ca-83e1cb608233","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:8e33d89845ef79fde663a3412a8342cde8d3e2ea7ec36ed93e938dfbfaeb4405","observation_id":"82b25f50-6f04-4bd9-a567-13d95ccd4b42","resolution":{"observed_at":"2026-05-26T05:51:46.773634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint=","venue":null,"work_id":"0d885b27-f816-4d33-b491-bc41ddfd5cab","year":2020},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:502f851c3b28282b337133ed6352a9b5097a51a7b0abeb7aafd461b5bc66c122","observation_id":"47434211-2451-46ad-b537-05a2aad74924","resolution":{"observed_at":"2026-05-26T05:51:46.785680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"State-transition interpolation and map adaptation for HMM-based dysarthric speech recognition","venue":null,"work_id":"86156880-e257-4e97-8946-2d630a670186","year":2010},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:23b81a0463c71688da03c61101bc5ac2ea668c078a174013c4cca2d5cf1afac6","observation_id":"dae98243-70fb-40e5-a150-56d58d85fa51","resolution":{"observed_at":"2026-05-26T05:51:46.793600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Estimation of Phoneme-Specific HMM Topologies for the Automatic Recognition of Dysarthric Speech , volume =","venue":null,"work_id":"13d62ceb-4bf3-4a21-9cb3-98b167c34a7b","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:bc94d84db58c9213486fba246aabf979fbcc12870d935a7590b8a550a60ce571","observation_id":"d8a3375b-1393-40c3-995f-9075ae3be6bd","resolution":{"observed_at":"2026-05-26T05:51:46.797546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of Interspeech 2016 , pages =","venue":null,"work_id":"3dc986e7-9099-4d48-bbf8-5e7c58bcb18b","year":2016},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:264483f3c077fbf21caf758f014248e396d18410aa0d40f3ac62acccf9736126","observation_id":"f9fb7c86-9838-4fd6-9a3e-fac60b4e4ccd","resolution":{"observed_at":"2026-05-26T05:51:46.765101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of Interspeech 2023 , pages =","venue":null,"work_id":"e4ae7319-6e28-4102-a346-97b6d79eb464","year":2023},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:f5ad0299dc9102aa59d122c0cc40f2d056b51ae6ff6fed4f122c5a84d366629e","observation_id":"461654aa-6da6-4048-92e6-80c647603d53","resolution":{"observed_at":"2026-05-26T05:51:46.804302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.compbiomed.2025.109954","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T08:05:16.230513Z","title":"Two-stage data augmentation for improved ASR performance for dysarthric speech , journal =","venue":null,"work_id":"2f2fca1b-5a36-4ec3-a229-b0de643b53da","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:e5831930a12bf745907df80122f1a8806550ca62cb05e26ba62d944501e5f772","observation_id":"eaf12820-967b-4bd4-b1bc-4aa1b86833ce","resolution":{"observed_at":"2026-05-08T18:08:53.426444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"c60dd660-3b69-47f5-9f50-5f2083657196","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:9a0157049f6d3a542201c430cf21ebb968d39d0fb3e08435fb393b5f4de059c9","observation_id":"43211658-e092-48a1-a61e-a4f84dfb50f8","resolution":{"observed_at":"2026-05-26T05:51:46.824345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"ac0d2df2-c619-4805-be47-d534c7b52cac","year":2024},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:d912473daff362f3709ace54205433fd42005c4917f67e435b3c6c5b302ebb5c","observation_id":"cd90e2c1-92c2-4c4b-b8ec-92aea2305c8f","resolution":{"observed_at":"2026-05-26T05:51:46.879111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"d966e588-a9c1-4684-8a89-a379e258b31d","year":2024},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:e3741fe1c2750a958f505d41013e48b337e89d9cc50893aca5f9c7cec38104d3","observation_id":"bdbdef6e-27b8-4b95-9824-665614cd2726","resolution":{"observed_at":"2026-05-26T05:51:46.816987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"27afaf45-99bd-48ac-828a-af4ea8c95569","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:502252ce04fe236c44fd7078d921727b1faa1c5342fe90a2f42df07452e6ed57","observation_id":"bb9911bf-b8dd-4e10-a4bc-14ad09125cdd","resolution":{"observed_at":"2026-05-26T05:51:46.812244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"71c301fc-1393-4f93-a82c-341a3edebc77","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:cc7c6ebda7721dbd2257eafb44037eb7283516ccd6d99b2c964c0a514caba97c","observation_id":"89fc1373-6409-4701-b7ee-bfb6bc4d0f5d","resolution":{"observed_at":"2026-05-26T05:51:46.748914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.apmr.2024.08.014","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urbina and Peter D","venue":null,"work_id":"6601a1cf-da0a-4d4d-a33d-59b1d8ecddb6","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:f1a820df32548e133dcef3326b4b264a9b3dab2f13ccfcd425c1e81f8d49e424","observation_id":"3521aa13-a46a-4964-af84-f56b5b91586a","resolution":{"observed_at":"2026-05-08T18:08:53.433304Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3726874","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , howpublished=","venue":null,"work_id":"7ca754e4-b5e2-4818-8b07-1df55f5ce11d","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:f7d07ee42bd8c3827623b6f5516788b983a388928cdb5ba095f351e6e68b0264","observation_id":"a0f455ef-ccc3-45eb-9e62-687c2a082f53","resolution":{"observed_at":"2026-05-08T18:08:53.416248Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jcjq.2023.10.006","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , howpublished=","venue":null,"work_id":"a09f0420-dba0-4498-9c3a-1634a348c54d","year":2024},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:a8225062653f16e720f91a4cb71540f20b0289751607629bfb8474af519beb12","observation_id":"9e1483b4-ded0-4f9d-9019-0125eab270ec","resolution":{"observed_at":"2026-05-08T18:08:53.412609Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:08:01.253485Z","title":"2021 , eprint=","venue":null,"work_id":"8e6d7443-6b29-4f76-94d1-3661d5f2a5ec","year":2021},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:577cee6c3fc4b3ac7c2538fcb4881e1ce22292986b2bc18f8bce758ec08d423b","observation_id":"b81bdc27-f711-4033-b93e-b126e8981e4f","resolution":{"observed_at":"2026-05-26T05:51:46.753016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"05d55caf-5350-49f7-ad23-8e20a5367609","year":2025},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:90a1261ccbf7989940ed59039a79187fa79ffb9942780bbbfd6eee8ec2a9ea18","observation_id":"0ec50091-831a-430d-b2c4-7fef8c9c57a1","resolution":{"observed_at":"2026-05-26T05:51:46.756634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/jstsp.2022.3182537","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:15:00.875560Z","title":null,"venue":null,"work_id":"1d0b6fda-c8e0-4de3-8b36-e7c2e0c88cf3","year":2022},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:b004669de9cc0fd0eed7fa806c8a625f72bbb9fdad73e04dc72aa10aa2c4ccf5","observation_id":"aa6951c3-96c7-4afd-b77e-7d82356f5c13","resolution":{"observed_at":"2026-05-08T18:08:53.421100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"title =","venue":null,"work_id":"59d4525f-b646-4a27-af44-0b38c0213c3c","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:9d6bbdacafe6160a2b2157b6b49a94f09e084d4390c434be1613cd3a2e014eb3","observation_id":"1a996b29-27d5-42a3-8a09-cd3a1776eaad","resolution":{"observed_at":"2026-05-26T05:51:46.760948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1044/2024_jslhr-24-00045","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Nelson, P","venue":null,"work_id":"2ade4fe5-16b5-4339-87bf-9452b4c3c0bf","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:85f46a04216d7a6018918ba4d7e2c0689baefe751a3fa5ea4a0c587ba5fdd674","observation_id":"6b7df4a9-0a82-41b1-b131-09227a6b6037","resolution":{"observed_at":"2026-05-08T18:08:53.408648Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Population: The 2012 National Health Interview Survey (NHIS) , author =","venue":null,"work_id":"7106a2a8-06cd-425b-9ec6-e0317fef5d4d","year":2012},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:b8a5be4320df92bfd1646b452dc43e5ba172f027e0084834dc7863272d664e9e","observation_id":"effc897b-06b1-4270-bd68-ecdd91200da2","resolution":{"observed_at":"2026-05-26T05:51:46.745153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variational Low-Rank Adaptation for Personalized Impaired Speech Recognition , year=","venue":null,"work_id":"a57119d0-5961-41df-a64c-901b1f467217","year":null},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:a7db818b83ddb37575c5745a1f2a60662bf359cbc5a3760b63122572e5e593a8","observation_id":"b951dcaf-82a2-4d5c-8d66-6fcbb76bfa96","resolution":{"observed_at":"2026-05-26T05:51:46.741151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2012 , publisher=","venue":null,"work_id":"45d29fdb-aea5-4504-b011-eaae58307084","year":2012},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:7d10a4879f1da17d288f1e70711587fada5963feb01419cfd578ad60eb43737b","observation_id":"b6eb8d56-71e8-43f0-8c4d-c461aa698559","resolution":{"observed_at":"2026-05-26T05:51:46.863170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":2,"verified_exact":10,"verified_fuzzy":34},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2605.02782."}