{"as_of":"2026-08-18T20:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:247c48102c77338e4791127ae9ad35a1c4bac4a38bf155fd865d48efa821bc5d","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T20:25:33.127942Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06831/citation-record","integrity":"/paper/2607.06831/integrity","json":"/paper/2607.06831/citation-record.json","paper":"/paper/2607.06831"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.748261Z","title":"The application of hidden Markov models in speech recognition,","venue":null,"work_id":"287e4ad3-d7b8-46fb-9154-426cceaa4441","year":2008},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:cd48c48b695a7b1792e0010e6d1799c6ddc887f2ed21197bae014631e7ebd8ab","observation_id":"d966a59c-cd8c-476f-a0b9-3b35211818d5","resolution":{"observed_at":"2026-07-10T20:27:36.749417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.731058Z","title":"A tutorial on hidden Markov models and selected applications in speech recognition,","venue":null,"work_id":"666af909-490d-4eb8-9c6e-996ed6863b15","year":1989},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:af1e9e713844e9bb1bb5c886d70ea139139c223d7aff7876ed61d19a311d4e37","observation_id":"d45345d8-d7fe-4b76-9a97-2b18a0f7cf52","resolution":{"observed_at":"2026-07-10T20:27:36.732459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.744776Z","title":"Montreal Forced Aligner: Trainable text-speech alignment using Kaldi,","venue":null,"work_id":"491e97e6-eea2-489f-be90-aa6794438fa8","year":2017},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:2580461720452ae2276d7652cb75bf4f6ed7acadaea8c95246f6056298702261","observation_id":"aeb462a3-2d33-4f03-b2df-157037d21e14","resolution":{"observed_at":"2026-07-10T20:27:36.745973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.746558Z","title":"Less peaky and more accurate CTC forced alignment by label priors,","venue":null,"work_id":"d099b94e-fd89-4e52-ac39-40a47491c8c8","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:2dd3bc3f6e6638ace0951f1503d146dac26676bb2987f85dd06a873656379b4d","observation_id":"6f3e1311-fec4-47c0-93b7-664107fb0ff3","resolution":{"observed_at":"2026-07-10T20:27:36.747709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.724873Z","title":"Tradition or inno- vation: A comparison of modern asr methods for forced alignment,","venue":null,"work_id":"a1201e26-d279-46e2-a1e6-ad0de6e11049","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:26a347b45b53fa4d77ffb5abf387605dab85ba4c428b65990da8a02ed6173b66","observation_id":"50d9969e-337f-4be5-8045-927e882fac6d","resolution":{"observed_at":"2026-07-10T20:27:36.726454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.741182Z","title":"End-to-end speech recognition: A survey,","venue":null,"work_id":"a8d57227-0fc2-46d2-9043-d9c95ae3866d","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:53a974c2a1ab43f291549401a1b9a5e275058535fb94f473f2d8e467a91a3060","observation_id":"810712ad-b30a-4540-a290-e964861f9a83","resolution":{"observed_at":"2026-07-10T20:27:36.742389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.732992Z","title":"Connection- ist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":"361a3f24-73a3-4f03-b53f-87a74c7c2373","year":2006},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:a5a0184a5d0ac16ea14e69859e909d09a976d7886fff3581dd18459b30226637","observation_id":"857bdb36-5b2c-4174-a6c7-da2b75041ccf","resolution":{"observed_at":"2026-07-10T20:27:36.734322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-08-15T00:39:21.296689Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":"1211.3711","doi":"10.48550/arxiv.1211.3711","metadata_source":"pith","pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sequence Transduction with Recurrent Neural Networks","venue":"cs.NE","work_id":"4553c1f9-9627-48f1-bcb4-69ce67d2ad80","year":2012},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:106b993cb6c757de50859284449d3e7a00bcae6dfe49c8a0ac533639abc469e0","observation_id":"c54e7385-2112-4562-ae87-af83100b8fae","resolution":{"observed_at":"2026-07-10T20:27:36.593477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.759019Z","title":"Attention-based models for speech recognition,","venue":null,"work_id":"b0a0cb06-aaa1-4b73-a8de-d1fc46f22d25","year":2015},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:acc9e23447ba3ed9f185cf0301754a18bb3e286e0e13d4dc0420a59fc9f7fad0","observation_id":"f47e5bcf-50fd-4cae-9ac1-d048fd931d7a","resolution":{"observed_at":"2026-07-10T20:27:36.760103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.757308Z","title":"Listen, attend and spell: A neural network for large vocabulary conversational speech recognition,","venue":null,"work_id":"ccf62408-c35b-49b6-bc1d-df48d0156977","year":2016},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:f0dcbc768b80772bce4241aecf47f00422bf1b661f0cab0ca050594c335e85dd","observation_id":"3a4df90a-b69d-4449-939a-776b5f7ec512","resolution":{"observed_at":"2026-07-10T20:27:36.758483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.735069Z","title":"Improved training of end-to- end attention models for speech recognition,","venue":null,"work_id":"bc9648d9-98b0-4b84-b984-8560af48772e","year":2018},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:e3f344361ebd16006830ce5c3511018f43b6fb06ddfc89919e7636a59fd16500","observation_id":"68e4eecd-db03-4145-b76c-bb713c403e0d","resolution":{"observed_at":"2026-07-10T20:27:36.736486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.727101Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":"882ec02b-7d10-412c-8b99-1142bd1ff2ba","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:a112b83bece58f0f547fb1c0c32b06a8e44f627bffa69f2802b3f815a7127bd7","observation_id":"9c46d745-96f8-469c-91f5-b5f7f68023dc","resolution":{"observed_at":"2026-07-10T20:27:36.728620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:1e1a569fe422b02db60f33a21ba3e61ce5e630dac8a7c791dd3cd3fcee415631","observation_id":"7ce561c0-0674-4ab2-b590-4b95fa456615","resolution":{"observed_at":"2026-07-10T20:27:36.581542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15045","last_updated":"2026-07-07T07:07:08Z","snapshot_observed_at":"2026-08-09T22:36:02.204265Z","submitted_at":"2026-03-16T09:57:06Z","title":"LLMs and Speech: Integration vs. Combination","version":3},"cited_work":{"arxiv_id":"2603.15045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.15045","snapshot_observed_at":"2026-07-10T20:27:36.586362Z","title":"LLMs and Speech: Integration vs. Combination","venue":"eess.AS","work_id":"b0692ac2-491b-450a-b8fa-698b22b6dacc","year":2026},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2603.15045","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:a19636ad4f0b31a8b313158ac1100beb91dd0d74387b3433a9f3fcf5852b6de8","observation_id":"399b1390-7481-4696-a009-023215cc1122","resolution":{"observed_at":"2026-07-10T20:27:36.588062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.780517Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"322d1e1e-90a5-43d7-967c-77e55461030f","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:1ff6297b0f064a1d128a59f8e28e6718d54bf40d4f2e2ef7a620d2ff5aa51cda","observation_id":"ae15985d-1df6-4eb3-bf05-092468164318","resolution":{"observed_at":"2026-07-10T20:27:36.781600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.753652Z","title":"WhisperX: Time-accurate speech transcription of long-form audio,","venue":null,"work_id":"b42cf93b-bc16-4316-98b3-46e0ebae8231","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:c7a431f5f7478c0b0dfdcf3d019414a606b31cc1f7601d8743f04778dfb32250","observation_id":"60c69c61-7a2a-4850-a787-41f8ad045c9d","resolution":{"observed_at":"2026-07-10T20:27:36.754796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.791214Z","title":"CrisperWhisper: Accurate timestamps on verbatim speech transcriptions,","venue":null,"work_id":"e3af4c17-1ae3-4195-a528-912c1976717f","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:e4e621a1f4574be8365ed47511f14b3a31197752d06787baccb484f4d474d82b","observation_id":"b199a002-115e-49f6-bdbb-7ae779d26b93","resolution":{"observed_at":"2026-07-10T20:27:36.792339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.787540Z","title":"Whisper has an internal word aligner,","venue":null,"work_id":"2859b057-746b-4e7f-ac87-6fcde9077245","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:b6d534785f74e61aee86ad0c9a6cb06c4bf1b92f8beb7919a0b777ff1e0bac84","observation_id":"f96fb2a6-db40-4145-a810-8a5fed11c603","resolution":{"observed_at":"2026-07-10T20:27:36.788911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19723","last_updated":"2024-10-18T11:54:14Z","snapshot_observed_at":"2026-08-16T13:56:31.765614Z","submitted_at":"2024-04-30T17:17:07Z","title":"Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2404.19723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.19723","snapshot_observed_at":"2026-07-10T20:27:36.603669Z","title":"Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech","venue":"eess.AS","work_id":"406bd3da-5b43-425e-be1c-d6690b475e40","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2404.19723","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:6da4ed37ebac018bf5e88f7e59dca93ad51531c96a452fb9f6c80fb54ea64527","observation_id":"fb35d85a-b9c4-4f0e-98b6-f83dc377ac08","resolution":{"observed_at":"2026-07-10T20:27:36.605092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31432","last_updated":"2026-05-29T15:27:26Z","snapshot_observed_at":"2026-08-12T14:19:48.428951Z","submitted_at":"2026-05-29T15:27:26Z","title":"DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs","version":1},"cited_work":{"arxiv_id":"2605.31432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.31432","snapshot_observed_at":"2026-07-10T20:27:36.583253Z","title":"DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs","venue":"cs.CL","work_id":"3ce6d94b-d015-4fad-93f8-48ef7d5235a6","year":2026},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2605.31432","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:c117d4d56385bbe7d248c40aced2398f1a450c8aa3b98051a618effb65f9dbe0","observation_id":"db745102-9d9f-4963-8f66-cf92f78b966d","resolution":{"observed_at":"2026-07-10T20:27:36.584712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.597298Z","title":"Available: https://arxiv.org/abs/2601.18220","venue":null,"work_id":"b6812bc0-16d1-443f-a8ad-8ef9e5c81882","year":2026},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:7f45514227a1fe9293f2bc8bb9a6b1e62a69d698ce0c6e1d629a5cde5fa4d160","observation_id":"8fa22560-df82-4b40-b451-dfd3f57a013f","resolution":{"observed_at":"2026-07-10T20:27:36.599158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6034","last_updated":"2014-04-19T11:54:52Z","snapshot_observed_at":"2026-08-17T14:45:30.096775Z","submitted_at":"2013-12-20T16:45:54Z","title":"Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps","version":2},"cited_work":{"arxiv_id":"1312.6034","doi":"10.48550/arxiv.1312.6034","metadata_source":"pith","pith_arxiv_id":"1312.6034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps","venue":"cs.CV","work_id":"4b5c8148-382f-461b-8caf-6da2a9acbef5","year":2013},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/1312.6034","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:eae476a2e1eacdf20a4bd9a01df4ce5117d815d974a64ce2040d8c95a3e2da7c","observation_id":"46faea88-3537-461b-89de-0bdc9534c20e","resolution":{"observed_at":"2026-07-10T20:27:36.610300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04521","last_updated":"2025-01-09T09:28:37Z","snapshot_observed_at":"2026-08-13T12:32:33.510196Z","submitted_at":"2025-01-08T14:14:19Z","title":"Right Label Context in End-to-End Training of Time-Synchronous ASR Models","version":2},"cited_work":{"arxiv_id":"2501.04521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.04521","snapshot_observed_at":"2026-07-10T20:27:36.589504Z","title":"Right Label Context in End-to-End Training of Time-Synchronous ASR Models","venue":"cs.SD","work_id":"7782d72d-8752-48e0-b4eb-1ddb9f6776c6","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2501.04521","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:097e05b4603e8e61f03ff9a37c7bff9f0f067e140b39b19c30ac34fd427d77b3","observation_id":"b5413ae3-61ac-42fb-8423-5534e301fb5b","resolution":{"observed_at":"2026-07-10T20:27:36.590845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.755370Z","title":"Saliency-driven word alignment interpretation for neural machine translation,","venue":null,"work_id":"621e16fe-1a50-4b01-aed4-6de426cee9fa","year":2019},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:c15309ed2ca063d3da706fdf1bd5b9da6ed25dfe0aa79886e9c60d8acf047706","observation_id":"14c126d0-ee23-44f9-996c-8862d3fdc5e3","resolution":{"observed_at":"2026-07-10T20:27:36.756579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.785710Z","title":"Joint CTC/attention decoding for end-to-end speech recognition,","venue":null,"work_id":"51c0858e-c564-474d-a809-9f922a33220d","year":2017},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:a07dd07d606b597059232cdf9a3de1fabf2dd5749acc454bfa1b1c9fd9c6119b","observation_id":"80b417cf-69a4-4c7a-8385-efd91f5a14d2","resolution":{"observed_at":"2026-07-10T20:27:36.786985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.783846Z","title":"Scaling speech tech- nology to 1,000+ languages,","venue":null,"work_id":"99bbb3e2-fb39-483c-ab8d-28ff7228bd18","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:7f4d78ba008284a35d9577ec750f530bd99a08d5ffe2d7bbf46a443199a3684c","observation_id":"2b14ce76-a4ce-442e-a644-f717c54a511d","resolution":{"observed_at":"2026-07-10T20:27:36.785158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.722646Z","title":"TorchAudio 2.1: Advancing speech recognition, self-supervised learning, and audio processing components for PyTorch,","venue":null,"work_id":"95b30d7b-6a66-4820-acad-8a8db2315465","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:622aae7d195ba91fd887d67a4d969ca81a62c986a27a100c499d8ca6df7598c1","observation_id":"141c56c5-d111-482b-ad7d-12872cc90159","resolution":{"observed_at":"2026-07-10T20:27:36.724159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.764453Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"95597efd-e3f2-46b8-8e97-4bf7aada8356","year":2020},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:260aa9bfe03d932170d287b11aad900bc812742e9e193f2187130d412ef77e50","observation_id":"7e474b36-d535-4835-af3f-56cce3229774","resolution":{"observed_at":"2026-07-10T20:27:36.765630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.768081Z","title":"Automatic phoneme recognition on TIMIT dataset with Wav2Vec 2.0,","venue":null,"work_id":"167526ea-c28e-49d0-a241-8d584cbd4828","year":2022},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:364ea48f3dc8111902457d84087f1a1ef9bc63631d987c703141158e0a4471bf","observation_id":"909c4e4a-76a3-4b23-afcd-9256897df7fd","resolution":{"observed_at":"2026-07-10T20:27:36.769218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.775374Z","title":"XLS-R: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":"9e566d81-0bbf-4752-8a84-84281c8486f7","year":2022},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:2c237aac32e814ca809e1f451d38ee8a9f7f41df18ce32ac43c44230e509b999","observation_id":"faa55225-00b2-46c4-bc19-88ece0e60d4c","resolution":{"observed_at":"2026-07-10T20:27:36.776543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.782113Z","title":"Fast conformer with linearly scalable attention for efficient speech recognition,","venue":null,"work_id":"0ac91775-5d15-4e09-bc66-35f6450f454d","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:cfbd3bdf8a74d19d4eac04d299e7ad03fe5187d9a9027c27cd2fbb32104fc51d","observation_id":"f8a77ee5-878e-41e4-9de1-0f4b186747bb","resolution":{"observed_at":"2026-07-10T20:27:36.783272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.789461Z","title":"OWSM v4: Improving open whisper-style speech models via data scaling and cleaning,","venue":null,"work_id":"9e11ca6c-4e6a-40af-9bd6-c115fab9580b","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:21f47e2123ca4b5d21e223c3ca3f9262ffad81cafcb0c749c647706057020f1b","observation_id":"e61fd5aa-ba69-4030-87ff-2ca320b7a803","resolution":{"observed_at":"2026-07-10T20:27:36.790646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.766191Z","title":"OWSM-CTC: An open encoder-only speech foundation model for speech recognition, translation, and language identification,","venue":null,"work_id":"76699e3f-2cb0-4c88-84c1-76a7501a152c","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:2fd67eed0ea9fb1b719c414a363d46deb3d29966d5a8b3ff93c8256d677240f1","observation_id":"192f1e8d-8680-45ed-9418-f3228e4196ea","resolution":{"observed_at":"2026-07-10T20:27:36.767507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.769760Z","title":"Stateful conformer with cache-based inference for streaming automatic speech recognition,","venue":null,"work_id":"03285169-fed5-4bfd-a1a1-6baa70a55175","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:7f5cb5b7a45f4b3ac8ec8a78c8afa74b667f2afbb33e247d68cbbd8b0faa658e","observation_id":"a9eaa9a3-1064-4281-b3d4-2894d73a38a3","resolution":{"observed_at":"2026-07-10T20:27:36.770999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.762563Z","title":"Efficient sequence transduction by jointly predicting tokens and durations,","venue":null,"work_id":"1c024f3e-4c99-4a6e-a752-a1d958082ea9","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:0be6f2af58273b0cf3f8b0235f041aa710a6cfd60b8b9f532380a1e317c1f427","observation_id":"6c777291-1348-41e2-85d0-09d8e82d52cf","resolution":{"observed_at":"2026-07-10T20:27:36.763726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.751881Z","title":"Emformer: Efficient memory transformer based acoustic model for low latency streaming speech recognition,","venue":null,"work_id":"efb54f6b-13ce-4424-90db-e235cbb30052","year":2021},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:4f7830cc83834641fe593d187434fcbe3c9a548456601d3a7f655a87b66839ef","observation_id":"2b966bde-edd6-4365-83b5-d13f50453e29","resolution":{"observed_at":"2026-07-10T20:27:36.753093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.777122Z","title":"TorchAudio: Building blocks for audio and speech processing,","venue":null,"work_id":"346e7e5e-43ba-449a-8277-60bbf2c6d736","year":2022},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:7c3f76f32504bf79afbc8a181af516dd50f8c5f052af4abf9b8f742be55ea3bf","observation_id":"bfa1780e-6102-4e67-b507-77b61a9746c3","resolution":{"observed_at":"2026-07-10T20:27:36.778265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.760822Z","title":"OWLS: Scaling laws for multilingual speech recognition and translation models,","venue":null,"work_id":"3ee63782-6d5a-4d29-bce8-a697a5774358","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:a0c64ef2f6c88c3a9102ba5a379650b9ae94c624874775b03531f73f54eb27c0","observation_id":"8d6223ec-4015-456d-ad38-511db9c02f77","resolution":{"observed_at":"2026-07-10T20:27:36.762010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:78ec8f04a36f479142917489b6ea3627801e227ca17680358c25e60ab23320a0","observation_id":"3db9f10c-f72e-4a63-802f-e476e6864eec","resolution":{"observed_at":"2026-07-10T20:27:36.607654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-15T22:57:45.773661Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:83f888c160abaf5c0064166f133d8b2c40b2f2d4b8da2b7dc7660c02c4715ee3","observation_id":"0f200d49-b50b-44bd-b3c5-d4edadfefd4d","resolution":{"observed_at":"2026-07-10T20:27:36.602301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.739063Z","title":"Less is more: Accurate speech recognition & translation without web-scale data,","venue":null,"work_id":"c8969a30-0e8f-4376-b63d-8438a2f9a8fe","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:77a51290e380799d2b4d5c3f611ca8be6ad8090f811da0b54364a08531376d1b","observation_id":"2d604f11-08f7-4c62-86ce-c490b9e6441f","resolution":{"observed_at":"2026-07-10T20:27:36.740428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.778820Z","title":"TIMIT acoustic-phonetic continuous speech corpus,","venue":null,"work_id":"276a9d17-171d-4a09-b033-6d54ac1714cb","year":1993},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:ea7316365348988bd2955eb41f14232e917e1e61ce09444ac5aa6b6f744e5fc0","observation_id":"5f231df0-a75d-4f6e-885a-dee428eb86c7","resolution":{"observed_at":"2026-07-10T20:27:36.779980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.742927Z","title":"The Buckeye corpus of conversational speech: Labeling conventions and a test of transcriber reliability,","venue":null,"work_id":"a382af78-b446-4205-a320-a2335b7612e9","year":2005},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:3784d1daf4f6af9eb7ffc4dce4111f33d23e4ef0d0a5b275158a48fa3ad325c3","observation_id":"84564faf-fd3a-448e-abb3-4dfb050d909e","resolution":{"observed_at":"2026-07-10T20:27:36.744190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.737190Z","title":"Learning important features through propagating activation differences,","venue":null,"work_id":"12c11178-cf2b-435a-8e22-1c479062cb4b","year":2017},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:48569a40be66219caad40151615047659745fdaebfaf3687b20faaafced08836","observation_id":"cc9ab90d-6d58-4ff2-8ea6-9c477c6d02dd","resolution":{"observed_at":"2026-07-10T20:27:36.738421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.749986Z","title":"Towards better understanding of gradient-based attribution methods for deep neural networks,","venue":null,"work_id":"e7d8517b-ee00-4603-9087-cfbf877dc797","year":2018},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:fcdec730bd228ffc5dfdd8b72c6bfa69e281d84a164193b24dbc8c05fa8848c9","observation_id":"d7e1feb3-8b81-4716-a2eb-1b8bbd2bf388","resolution":{"observed_at":"2026-07-10T20:27:36.751310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03825","last_updated":"2017-06-12T19:53:30Z","snapshot_observed_at":"2026-08-14T20:54:30.978618Z","submitted_at":"2017-06-12T19:53:30Z","title":"SmoothGrad: removing noise by adding noise","version":1},"cited_work":{"arxiv_id":"1706.03825","doi":"10.48550/arxiv.1706.03825","metadata_source":"pith","pith_arxiv_id":"1706.03825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmoothGrad: removing noise by adding noise","venue":"cs.LG","work_id":"9fe7734e-4726-441f-abc1-88bbce75815c","year":2017},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/1706.03825","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:595eb031755a4b89776b2c854cad9b8967718e630861c54543a51f5ff1a43788","observation_id":"2290b8b4-2ec2-4619-9cca-56ae8b26d3dc","resolution":{"observed_at":"2026-07-10T20:27:36.596077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.771544Z","title":"Sanity checks for saliency maps,","venue":null,"work_id":"6002cd4a-31bf-42ae-a046-f0422c278d79","year":null},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:898cd92353dfd8a4a67abead553393390d096fc2637b074b2738085d35f1260a","observation_id":"5ba70317-85aa-43c0-a86f-3db544ec09e8","resolution":{"observed_at":"2026-07-10T20:27:36.772994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.792876Z","title":"Available: https://proceedings.neurips.cc/paper files/ paper/2018/file/294a8ed24b1ad22ec2e7efea049b8737-Paper.pdf","venue":null,"work_id":"832aea5c-ed79-4d21-a900-3f5be9053ec8","year":2018},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:c01845fce9c22f594ed970439785ccf73661405f46b483d2c3df89cba78d3ec3","observation_id":"41457776-1484-4b60-adca-67d6ee3eee18","resolution":{"observed_at":"2026-07-10T20:27:36.794010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.729255Z","title":"Axiomatic attribution for deep networks,","venue":null,"work_id":"ed84816f-db48-4850-b644-367e423ae7fe","year":2017},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:aee75f4e215c35835af6109940b578002e981685803e37839bf54e6744a9ffee","observation_id":"c0fb4029-8cc0-4385-9891-18f15ccd52b5","resolution":{"observed_at":"2026-07-10T20:27:36.730491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.773596Z","title":"Improving performance of deep learning models with axiomatic attribution priors and expected gradients,","venue":null,"work_id":"c6a61a4d-4405-49a9-8a75-a354d72baa48","year":2021},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:e7ea3009ee626228a39aa331c351c47b20092f112fa1740f86c2bdc01fb9ca3d","observation_id":"bb1834f8-f027-4183-b870-7fb7c94926f4","resolution":{"observed_at":"2026-07-10T20:27:36.774812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:43:22.125783Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":39},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2607.06831."}