{"as_of":"2026-08-08T01:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3ccc2e00f779e0d526c24aab5b140af47e508e2b98e92b48f3cbb0e734a5954","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T17:17:56.737611Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T17:17:56.737611Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-11T07:06:12.250682Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"cited_work":{"arxiv_id":"2604.08384","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08384","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","venue":"eess.AS","work_id":"830552fe-cd85-473f-8ed3-d90f8b89b6f5","year":2026},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2604.08384","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:ff5065642c0ffe2df7451656f86509bd4458a47d87cd45ee85dacf006d025c2c","observation_id":"5fa10839-6a22-4b5c-9837-9e2669920d78","resolution":{"observed_at":"2026-05-11T07:06:12.315956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.08384/citation-record","integrity":"/paper/2604.08384/integrity","json":"/paper/2604.08384/citation-record.json","paper":"/paper/2604.08384"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"68145d14-bdef-4a0b-8e8f-008e39100cff","year":null},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:133db9110fba106258bc75a037805cff901eaa25bdd5e9d52eb13cfa606c29fd","observation_id":"cc4fc86a-6ca9-4141-8abf-edde5dbb542c","resolution":{"observed_at":"2026-05-17T11:09:29.371593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"cited_work":{"arxiv_id":"2604.08384","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08384","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","venue":"eess.AS","work_id":"830552fe-cd85-473f-8ed3-d90f8b89b6f5","year":2026},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2604.08384","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:ff5065642c0ffe2df7451656f86509bd4458a47d87cd45ee85dacf006d025c2c","observation_id":"5fa10839-6a22-4b5c-9837-9e2669920d78","resolution":{"observed_at":"2026-05-11T07:06:12.315956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5b7717a9-0843-4a10-abbd-2877f318640d","year":null},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:7146d48e51b7a598ac5ef858ed421684d7ccaaa132585bd619d62f35788032a4","observation_id":"74106f46-641c-49d6-a253-66edb0e97806","resolution":{"observed_at":"2026-05-17T11:09:29.363488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"generalization, and (ii) low-resource domain adaptation","venue":null,"work_id":"2d4d73a0-e5e0-49a5-a414-514f550e388c","year":null},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:f42107c987512801295bc3252377f485a460ffa4aae635a4a8129a7be10aa26a","observation_id":"c3794b6a-e30c-44ca-86ee-b9b4bcf7c907","resolution":{"observed_at":"2026-05-17T11:09:29.367876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Table 2 probes whether simulated posteriors improve CTC-style alignment and cross-domain generalization without audio training","venue":null,"work_id":"f0dfab92-9886-4c9d-8f61-bf4cd5e56def","year":null},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:24bc9c5702aafd704d513c75be5c1c63d4e64db1ed22e749aa02337ca2740086","observation_id":"fee919b0-c359-4bcd-ba00-e0deeb49824a","resolution":{"observed_at":"2026-05-17T11:09:29.383357Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"By generat- ing pseudo posteriors that better match acoustic CTC behavior, TASU2 provides stronger alignment signals for speech foun- dation models and Speech LLMs","venue":null,"work_id":"39651f13-4ec2-40df-8cd8-9faf5a919466","year":null},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:54f52d60c9e2dc7c0e13508996f72b3136607752eaec08083b2420e63bdc75eb","observation_id":"bbd588e3-8d3c-41d1-8ff0-5393aef3f9a2","resolution":{"observed_at":"2026-05-17T11:09:29.379732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"87127441-9497-4b0b-9d7d-247f0dac7fc2","year":null},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:69552d0bd59f7b06b1fb8baff942b14087e92f6861aafad24b038fc2a4ffb5de","observation_id":"642e6e31-b0ae-40f5-aef2-2786b3dab254","resolution":{"observed_at":"2026-05-17T11:09:29.374952Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.364053","doi":"10.1109/jstsp.2025.3640535","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey on speech large language models for understanding","venue":"IEEE Journal of Selected Topics in Signal Processing","work_id":"2cea22c9-43e0-4250-b32f-46ff127e5402","year":2025},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:3f8fde0e056bd92dea3881552dd521d8133a57524d7ddff1a103d6a3012bca4e","observation_id":"50287b34-59aa-4b99-86d6-2457e0bd1d62","resolution":{"observed_at":"2026-05-10T17:20:38.428745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the landscape of spoken language models: A comprehensive survey","venue":null,"work_id":"534a6464-3cf4-448f-93ae-93cfbf82838a","year":null},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:0499a323d09bd3b8dc0d7714cdbda6487be3af13d87a7c2521feba0921068970","observation_id":"949a17d7-c4ae-4029-9c1d-36febd688001","resolution":{"observed_at":"2026-05-17T11:09:29.386862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2504.08528","doi":"10.48550/arxiv.2504.08528","metadata_source":"pith","pith_arxiv_id":"2504.08528","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","venue":"cs.CL","work_id":"92746bbc-1fe6-410d-a1e9-8afab3e0a8e5","year":2025},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2504.08528","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:52e52caa8fbfde214cb5822442805623f3108bb40846779a052f931f0ef67acf","observation_id":"fc22db11-27fe-4f24-b9ed-19c7e66819e5","resolution":{"observed_at":"2026-05-11T07:06:11.637295Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:102095c8412dbd08d28327cbba8e76606743443fff4530d9f7d153edccd4deea","observation_id":"1062955e-4f00-4601-908f-89f2e8c2c067","resolution":{"observed_at":"2026-05-11T07:06:11.965151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tasu: Text-only alignment for speech understanding","venue":null,"work_id":"7e2dca0b-0039-46a7-93c9-1d6f38b9d1a9","year":null},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:90aa741a81daa1004aaf8a9ef2cd73f854748709058618bfc3efbb292277da1f","observation_id":"6553157c-282b-412f-b2e7-38c2efd85f8a","resolution":{"observed_at":"2026-05-17T11:09:29.393553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:37:30.595884Z","title":"Available: https://arxiv.org/abs/2511.03310","venue":null,"work_id":"4d623d94-692b-4977-9e27-2eef00d1b6b8","year":null},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:849f6f9605b6d125f66fc3cfa6d2f8068ec91828a57d80318561e90af3c9e494","observation_id":"84555d19-1ebf-440c-ac4a-79e026463336","resolution":{"observed_at":"2026-05-11T07:06:12.046496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11352","last_updated":"2025-05-16T15:15:19Z","snapshot_observed_at":"2026-08-07T15:44:37.704742Z","submitted_at":"2025-05-16T15:15:19Z","title":"LegoSLM: Connecting LLM with Speech Encoder using CTC Posteriors","version":1},"cited_work":{"arxiv_id":"2505.11352","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11352","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Legoslm: Connecting llm with speech encoder using ctc posteriors","venue":null,"work_id":"d78174a0-9a0b-49f5-8115-8e520ac1e373","year":2025},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2505.11352","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:4989e99ea4958df05bb03694ded4b16e11c302b928481ebbed278882ca763b07","observation_id":"517bb2a6-80bf-4895-8464-a4e1c67de9e3","resolution":{"observed_at":"2026-05-11T07:06:13.016146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alignformer: Modality matching can achieve better zero-shot instruction- following speech-llm","venue":null,"work_id":"fc6652f6-cd6c-4374-bd5d-2d29e0048ee4","year":2025},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:5676ef50723b1e647bed0dac8a2cbe32cc345f3064a98aeea3521576863dfe83","observation_id":"be4cee44-e4c1-4c69-80ac-143e4e0fd0b8","resolution":{"observed_at":"2026-05-17T11:09:29.390153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving automatic speech recogni- tion performance for low-resource languages with self-supervised models","venue":null,"work_id":"f1f21d7f-46eb-4ef9-bff4-cf319302e275","year":2022},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:e7793b4f7da63544bb477bde72e1cb026c808c20a3d43eb5ca50ea12bbd101b1","observation_id":"7d95f8e0-c68c-4796-9555-73529d98518f","resolution":{"observed_at":"2026-05-17T11:09:29.400514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00216","last_updated":"2022-07-01T05:54:01Z","snapshot_observed_at":"2026-08-07T22:24:37.946178Z","submitted_at":"2022-07-01T05:54:01Z","title":"Updating Only Encoders Prevents Catastrophic Forgetting of End-to-End ASR Models","version":1},"cited_work":{"arxiv_id":"2207.00216","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.00216","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Updating only encoders prevents catastrophic forgetting of end-to-end asr models","venue":null,"work_id":"fa749521-4010-4f8d-adc2-f6badde84356","year":2022},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2207.00216","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:ea5ce85c32b2ace6ffcf1126cfa95d5aa0728eef0b833d4aca2feccd98c613a1","observation_id":"8aeb3fb0-c43c-4e90-b2aa-2687762be0b7","resolution":{"observed_at":"2026-05-11T07:06:12.516013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.20900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:56:57.804355Z","title":"Text-only adaptation in llm- based asr through text denoising","venue":null,"work_id":"8141632d-618f-41f0-b36f-ba855f3dfe04","year":2026},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:592e5c6768313a18f38df724a38e79841a699844a661f2b68e2ef9f09059de24","observation_id":"5cfe32ca-4174-4ec7-be4c-c9739f90a2aa","resolution":{"observed_at":"2026-05-11T07:06:12.846187Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot domain-sensitive speech recognition with prompt- conditioning fine-tuning","venue":null,"work_id":"53743c52-d078-4262-8303-95a4477134f5","year":2023},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:8c6d38f59ed1c92c744c803af781e1a652e52ac40f4f74590cfb4d30e5665423","observation_id":"bf116189-af5a-4d08-b05e-5ea15a88e8f8","resolution":{"observed_at":"2026-05-17T11:09:29.409985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.05671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:29:39.073028Z","title":"Low-resource domain adaptation for speech LLMs via text-only fine-tuning","venue":null,"work_id":"271c4a0d-986e-49fa-9325-743a21ee95ba","year":2025},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:3dfe33302d592292182ef1083bd83363f8ef10bed9b7e7e4f873758c6816fe9b","observation_id":"9bf6f57b-42c7-4eae-a05b-d5849a2a86d5","resolution":{"observed_at":"2026-05-11T07:06:12.342267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00618","last_updated":"2023-05-20T16:59:28Z","snapshot_observed_at":"2026-07-06T12:55:48.734431Z","submitted_at":"2022-03-29T11:55:30Z","title":"ASR data augmentation in low-resource settings using cross-lingual multi-speaker TTS and cross-lingual voice conversion","version":5},"cited_work":{"arxiv_id":"2204.00618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.00618","snapshot_observed_at":"2026-07-03T22:49:03.078235Z","title":"Asr data augmentation in low-resource settings using cross-lingual multi-speaker tts and cross-lingual voice conversion","venue":null,"work_id":"10eabd00-3a3e-4cf1-9abf-ec9ddb23e36d","year":2022},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2204.00618","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:6fdec85d04473e8512d3cb6180426e5b7864ccc2ad8998ddbd08aac4fb266354","observation_id":"d6203fe9-a089-4b1c-af78-4bfc4caa93e2","resolution":{"observed_at":"2026-05-11T07:06:12.245913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17017","last_updated":"2023-06-27T00:39:38Z","snapshot_observed_at":"2026-07-06T14:12:18.389495Z","submitted_at":"2022-10-31T02:12:51Z","title":"Blank Collapse: Compressing CTC emission for the faster decoding","version":2},"cited_work":{"arxiv_id":"2210.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.17017","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blank collapse: Compressing ctc emission for the faster decoding","venue":null,"work_id":"8a04f407-02cb-4696-b697-32b19c8f7ccc","year":2023},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2210.17017","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:ce5c067bcd7d43de715e10071de34fe09aea6db27f3457203d6c3982417fee5e","observation_id":"2ad73b84-a0ae-443b-8cc5-5177a6921828","resolution":{"observed_at":"2026-05-11T07:06:12.669175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07254","last_updated":"2021-12-14T09:38:31Z","snapshot_observed_at":"2026-08-04T18:20:41.266118Z","submitted_at":"2021-12-14T09:38:31Z","title":"Improving Hybrid CTC/Attention End-to-end Speech Recognition with Pretrained Acoustic and Language Model","version":1},"cited_work":{"arxiv_id":"2112.07254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.07254","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving hybrid ctc/attention end-to-end speech recognition with pretrained acoustic and language model","venue":null,"work_id":"7f448f2f-870d-4977-a0ba-fb75b985299b","year":2021},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2112.07254","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:94e22d856c68650abc9096c8a2a3956035b18d4418f6aa4d0182ae115fca7614","observation_id":"11922a35-06ec-4a42-bb1f-ff000f0bd364","resolution":{"observed_at":"2026-05-11T07:06:12.157812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phone synchronous decod- ing with ctc lattice","venue":null,"work_id":"5d7221bf-bd3a-4fe7-9833-65886d624156","year":2016},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:d468e4f84eeb38fdf158feda1c71c502ec04def17ece5c4dbf23961b100902e7","observation_id":"edf43090-ebe6-410b-86d2-eba6549bf601","resolution":{"observed_at":"2026-05-17T11:09:29.407022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11353","last_updated":"2023-11-19T15:31:42Z","snapshot_observed_at":"2026-07-06T16:49:37.985402Z","submitted_at":"2023-11-19T15:31:42Z","title":"Label-Synchronous Neural Transducer for Adaptable Online E2E Speech Recognition","version":1},"cited_work":{"arxiv_id":"2311.11353","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.11353","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Label-synchronous neural transducer for adaptable online e2e speech recognition","venue":null,"work_id":"c5bdd134-cf8f-4345-b286-4ee21dcff2fc","year":2023},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2311.11353","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:276c052a70509c04cbb1c89858d8623ba1a875baab01545298443c3a2c6e14e7","observation_id":"b2443b6c-f14d-4544-9bb3-07f72366e253","resolution":{"observed_at":"2026-05-11T07:06:11.728775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-06T00:42:36.144034Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":"2407.04051","doi":"10.48550/arxiv.2407.04051","metadata_source":"pith","pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Funaudiollm: Voice understanding and generation foundation models for natural interaction between humans and llms.arXiv preprint arXiv:2407.04051","venue":"cs.SD","work_id":"7cd6d289-dca2-414f-99e0-809f37c065fa","year":2024},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:a61da1011534d98e946fe4366fa6a11a12c2d3ac7a92cd82978965bfa41480f6","observation_id":"d677edc5-aa76-4171-9e60-5c81fe771d2c","resolution":{"observed_at":"2026-05-11T07:06:12.756590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:52.218158+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:52.218158+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:75f242059992b2c8aae2bd040f49f00de6dc684c3f0400e79837da20fd2520db","observation_id":"cb570388-3612-4b3d-b789-1a7126c3d789","resolution":{"observed_at":"2026-05-11T07:06:12.549556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:32:25.940177Z","title":"Lib- rispeech: An asr corpus based on public domain audio books","venue":null,"work_id":"4dc39a57-144b-4c81-a4a8-a17b1356e24a","year":2015},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:bd5cbec8f0dfb645a44704edd89c3443b9d697d9680b1d36f4e0ae40e8c4ec11","observation_id":"395c7da2-5f42-4460-a121-a390e9e2af37","resolution":{"observed_at":"2026-05-17T11:09:29.413642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Medical speech, transcription, and intent","venue":null,"work_id":"fc5ecf96-ab6a-4f0d-b81b-fadf80dcf0eb","year":2019},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:0c7b9e568b5890c946ae895936b8472b3f076056c3ec672a1d8c85da2439fbba","observation_id":"3839cacb-3955-4874-a7fd-05f49eb707ac","resolution":{"observed_at":"2026-05-17T11:09:29.396916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-319-99579-3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hernandez, V","venue":"Lecture notes in computer science","work_id":"fe1453c5-d493-4be1-87b6-68bb9bc762d8","year":2018},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:c1da704df69a1af9716e8f6168c6348dfcbcbe073f12b52aaa06232200841a6a","observation_id":"dd6adfa2-b408-445b-ac9b-1fbf2a327788","resolution":{"observed_at":"2026-05-10T17:20:38.430409Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slidespeech: A large-scale slide-enriched audio-visual corpus","venue":null,"work_id":"89ac74a0-ff8f-4d52-b342-722c2199a9ef","year":null},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:5b23c85dc625adb5dcca55163bdb8653781087778be5d0122f432d37a975aa31","observation_id":"9932684a-9e52-4243-a4eb-11d3dd24930b","resolution":{"observed_at":"2026-05-17T11:09:29.403803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05396","last_updated":"2023-12-25T13:01:00Z","snapshot_observed_at":"2026-08-03T13:45:04.353365Z","submitted_at":"2023-09-11T11:56:44Z","title":"SlideSpeech: A Large-Scale Slide-Enriched Audio-Visual Corpus","version":3},"cited_work":{"arxiv_id":"2309.05396","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05396","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Available: https://arxiv.org/abs/2309.05396","venue":null,"work_id":"3a53549c-45ff-4af7-b9c1-8f7b837e7920","year":null},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"cited_paper":"/paper/2309.05396","citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:d2725a174a3cda0c56957e74ce9448ac0c92a59177077c3b00af06784e85f236","observation_id":"2ef514e5-477f-4d03-b87e-86d2acf49887","resolution":{"observed_at":"2026-05-11T07:06:11.846015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoVoST2 and massively multilingual speech-to- text translation","venue":null,"work_id":"ffba5457-ec4b-4e24-9169-29a139acd613","year":2021},"citing_paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T17:17:56.737611Z"},"links":{"citing_paper":"/paper/2604.08384"},"observation_digest":"sha256:16d3a9d2f5bbe341fd20acdc6cdfa38863b646de7fff8861d27225f52e2f687e","observation_id":"28942c7b-e034-45e0-a801-8b630621a7f5","resolution":{"observed_at":"2026-05-17T11:09:29.416992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.08384","last_updated":"2026-04-09T15:44:45Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-03T00:38:27.163498Z","submitted_at":"2026-04-09T15:44:45Z","title":"TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":16,"verified_fuzzy":12},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2604.08384."}