{"as_of":"2026-08-06T18:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf68be6ced37e2c63ec0185e623e5764c3cc878275cdd23ebc0b227b9d0b709f","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:41:25.045627Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:45:11.099531Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12825","snapshot_observed_at":"2026-08-02T20:45:11.099531Z","title":"Autoregres- sive speech enhancement via acoustic tokens,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22417","last_updated":"2026-06-04T10:49:29Z","snapshot_observed_at":"2026-08-05T23:48:14.013426Z","submitted_at":"2026-02-25T21:22:08Z","title":"Absorbing Discrete Diffusion for Speech Enhancement","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T20:45:11.099531Z"},"links":{"cited_paper":"/paper/2507.12825","citing_paper":"/paper/2602.22417"},"observation_digest":"sha256:f8cd0b1acc8f8d3b94a8e9044310caa62279b3e75dcc8bb823ff9e1b71767472","observation_id":"99f1c4fc-b32d-42bc-8a36-6960e5ecc296","resolution":{"observed_at":"2026-08-02T20:45:11.099531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12825/citation-record","integrity":"/paper/2507.12825/integrity","json":"/paper/2507.12825/citation-record.json","paper":"/paper/2507.12825"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:32.112495Z","title":"MetricGAN-U: Unsupervised speech enhancement / dereverberation based only on noisy / reverberated speech,","venue":null,"work_id":"c3654d0b-d132-4f5a-95ec-7f77416f42a5","year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.393607Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:46c576ae81de3938b7e481a2a1d8c08d09bb88887ebf6013196a3736cfc8958b","observation_id":"3df6dd21-9582-46bf-91f6-9737edb1dd06","resolution":{"observed_at":"2026-08-06T16:41:32.193083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:31.795018Z","title":"MetricGAN: Generative adversarial networks based black-box metric scores optimization for speech enhancement,","venue":null,"work_id":"b385c193-55da-4985-80cf-db628e5eabdc","year":2019},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.398740Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:5b0395bfcc228bf13a05298fe078aa8bb0d8edfc046fee04276a279f65b89a46","observation_id":"ee931f9a-7cf5-40a5-aae5-9fafa6a6534b","resolution":{"observed_at":"2026-08-06T16:41:31.979967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:31.617635Z","title":"MetricGAN+: An improved version of MetricGAN for speech enhancement,","venue":null,"work_id":"a20e8214-552d-41f7-80a0-2e3c265dcff5","year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.401797Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:0aa66ecbbf45d027f2775c9ba3a68d63fc06a784a27aa1c8a04b8d06c3b2d1cd","observation_id":"005efad6-f48e-4d49-9b48-891d41d0a537","resolution":{"observed_at":"2026-08-06T16:41:31.700241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:31.500558Z","title":"Reinforcement learning based speech enhancement for robust speech recognition,","venue":null,"work_id":"989d40a9-a8e3-4472-9f6c-852e63cb87fb","year":2019},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.541441Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:2e13bcc6328ce80ba8423be0dded1616366cb13a01e83c67bfd8356303432d95","observation_id":"60630760-ea59-47eb-9775-ffe6c04d6464","resolution":{"observed_at":"2026-08-06T16:41:31.564883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:31.330627Z","title":"MetaRL-SE: a few-shot speech enhancement method based on meta-reinforcement learning,","venue":null,"work_id":"6e211d39-b20f-4f4f-ae65-15f11d9bc8bf","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.626694Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:2e6647e595e4564863c1994935e8c80ac5c45557d82a0e1bf1a3badfb9dee1b0","observation_id":"7db48736-4f7e-4eb3-a339-8ae2c857983a","resolution":{"observed_at":"2026-08-06T16:41:31.428773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:31.158085Z","title":"Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"188eb2dd-cd17-4094-8fc8-0d15037fb074","year":2001},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.717389Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:2cc87fa14e8c14be1fb82cb8f2c3f7ee09355f309d2e2ab5a9932c197b9549ca","observation_id":"4a0c77a7-5317-4dba-a4b9-4d7921ce76c8","resolution":{"observed_at":"2026-08-06T16:41:31.202572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:31.033040Z","title":"An algorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":"dbacd381-742a-479b-b147-19e681930e79","year":2011},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.785033Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:a9d14db41c5f8fea881548b137622c71ba5be98d03efcd67637d2c463b10a053","observation_id":"1ea95bef-9ff6-4e26-8b0f-5a5f0968521e","resolution":{"observed_at":"2026-08-06T16:41:31.092612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.923445Z","title":"Conv-TasNet: Surpassing ideal time–frequency magnitude masking for speech separation,","venue":null,"work_id":"bfa0b847-3fd8-4616-a022-aed13d24a55a","year":2019},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.881954Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:63b1af682ed51682fea4f8a2944e06f8f8386f43d412e28437e6f874e5bf590e","observation_id":"813ca669-e79a-4edc-97a6-2eb96bcc5fda","resolution":{"observed_at":"2026-08-06T16:41:30.990140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.779297Z","title":"Attention is all you need in speech separation,","venue":null,"work_id":"deddf372-f851-491d-90e2-7d7d23a59715","year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.916913Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:5aad95bc45eea0f96733218084d4c524eb165e700b50c607aeb0a9d71fb1c431","observation_id":"9b536600-b151-42c1-a9b7-737dea7d705a","resolution":{"observed_at":"2026-08-06T16:41:30.872986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.620210Z","title":"Real time speech enhancement in the waveform domain,","venue":null,"work_id":"4476d170-edd8-4ce7-9db0-eb635872f013","year":2020},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:20.996481Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:74d8d51612b8a08a26a2b414d6687eddb67a0ccfc35aeed007d816fb8cbcb4f6","observation_id":"fd7b1bf2-56d2-4d9a-a123-c6c596f8e5e7","resolution":{"observed_at":"2026-08-06T16:41:30.679297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.491786Z","title":"DNN-based enhancement of noisy and reverberant speech,","venue":null,"work_id":"cdcc6ba5-f671-4410-883c-7531060ffa5c","year":2016},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.096292Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:0b673ec0b96447f6e80b90bb0f5c79345e881a0a3d656d6239d0fab97ff961f7","observation_id":"6489b662-1f5b-419b-9a0a-55a0e55e6e5a","resolution":{"observed_at":"2026-08-06T16:41:30.562523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.341654Z","title":"Phasen: A phase-and-harmonics-aware speech enhancement network,","venue":null,"work_id":"6f519858-2dbf-48d3-b5e9-beb1da453690","year":2020},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.162198Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:68f87445d5fe3d5690a73927c221a02cfa09a422193ffcdc6eef38150c8605a5","observation_id":"1beafc15-0309-417f-b6da-3ad0d9dc3d3b","resolution":{"observed_at":"2026-08-06T16:41:30.416171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.196628Z","title":"Inter-SubNet: Speech enhancement with subband interaction,","venue":null,"work_id":"a412ff84-7414-46ef-b548-f9a5e0d9355e","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.228554Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:b89103c191f9cf14a34ea373581daa3b860bf060283655a3e77ff196f07516ba","observation_id":"2f12fc1a-ab0c-4be1-bf41-f9e334877e9d","resolution":{"observed_at":"2026-08-06T16:41:30.276332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:30.032080Z","title":"Speech enhancement with score- based generative models in the complex STFT domain,","venue":null,"work_id":"c06ca064-c774-4a62-8624-4e288e95ec2a","year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.285617Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:5fae079c80d0daa9fb5bad64e4ec9b539f4e23aafa958422d9ff09e0de002d75","observation_id":"088a276e-0244-4d8d-a220-8b91476d8729","resolution":{"observed_at":"2026-08-06T16:41:30.099067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.863919Z","title":"Speech enhancement and dereverberation with diffusion-based generative models,","venue":null,"work_id":"24392ec0-d678-4546-85b1-ff993e75d2ba","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.330011Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:00a69f4f488511a9e3e5e2204acbe10a80b3488db71162ca4ce2438cdd288b0e","observation_id":"5e1b7c46-5668-4312-9626-8d58d571b29d","resolution":{"observed_at":"2026-08-06T16:41:29.958000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T16:41:21.361135Z","title":"Gemini: A family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.361135Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:2c9829d2e3d9a4afe3f785be0f22a29ae5e99e12b4ecb33de8202260baa6e5d9","observation_id":"8613889f-de51-4e65-9069-7964de0f0b66","resolution":{"observed_at":"2026-08-06T16:41:21.361135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.769818Z","title":"AudioLM: A language modeling approach to audio generation,","venue":null,"work_id":"d696a8b6-460b-4bad-aeaf-692d9d37f9ed","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.498944Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:fd72975abbd89e7ee70bb423ac49ae222752e6fff549ac31b8b3071e084298fa","observation_id":"1653c9ff-4f6d-4f06-9496-192d1dbb9766","resolution":{"observed_at":"2026-08-06T16:41:29.818197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T16:41:21.629566Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.629566Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:82bf9b2c325e60ba3a0c70f2e5100a84a1de313c8802f36926c38b5ecb12ea34","observation_id":"74a3577c-1780-4876-b29a-82e23297da18","resolution":{"observed_at":"2026-08-06T16:41:21.629566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.583700Z","title":"AudioGen: Textually guided audio generation,","venue":null,"work_id":"856eb329-154a-4322-828c-65aad800bd88","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.722632Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:a893a5fee344911ea491378a6019c3ce75b9fdf88b4b8070d0c603efe6910d0f","observation_id":"6671abdb-b415-4c7b-bd0b-a128cb41d808","resolution":{"observed_at":"2026-08-06T16:41:29.706948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.405958Z","title":"Simple and controllable music generation,","venue":null,"work_id":"c1f19d17-1c48-48e5-8255-d9af51fad6cb","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.768399Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:881082ab00da082e5f0bb5df84fb03041f262dbac91addccf7795d26853cbe03","observation_id":"d9e1c638-9978-44cd-a597-733794d16616","resolution":{"observed_at":"2026-08-06T16:41:29.481724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.283236Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":"2acb5428-c2cc-4b8b-a88f-366cc17d6b8a","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.816868Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:2f00d45517ac1e9df8c44d408ce3895c07094a847f2c673dec10d169c0c142ac","observation_id":"6938a232-7650-4d7a-ada5-1fe8f8a563f0","resolution":{"observed_at":"2026-08-06T16:41:29.334844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05755","last_updated":"2024-10-18T19:18:41Z","snapshot_observed_at":"2026-07-06T17:27:29.050237Z","submitted_at":"2024-02-08T15:39:32Z","title":"Spirit LM: Interleaved Spoken and Written Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05755","snapshot_observed_at":"2026-08-06T16:41:21.849466Z","title":"SpiRit-LM: Interleaved spoken and written language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.849466Z"},"links":{"cited_paper":"/paper/2402.05755","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:eb47099c8a0e81e49adb6e0136fb2070093b7898974d4d9dd39c5c92c07ddc93","observation_id":"58acb5af-7763-4fe8-8b7d-e28357526c51","resolution":{"observed_at":"2026-08-06T16:41:21.849466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-05T18:34:08.469382Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-06T16:41:21.923372Z","title":"NaturalSpeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.923372Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:930f31ff6987d69093e2b9b02cffbc1bd79a151ba3e237ddae9607539c460dc9","observation_id":"0b40a5bc-c4cd-4454-a726-dccb894137ab","resolution":{"observed_at":"2026-08-06T16:41:21.923372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.169648Z","title":"CLam-TTS: Improving neural codec language model for zero-shot text-to-speech,","venue":null,"work_id":"58c38b5e-7722-43f3-bf05-b3584a4a5ca6","year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:21.970115Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:e33c217ede81b216fdf01eb8e0ac8baf93249c498c1301c0b651a86ef3be4d24","observation_id":"30664f26-4e77-4c0e-ad97-2d57f991eedc","resolution":{"observed_at":"2026-08-06T16:41:29.225692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:29.043071Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"2ece4586-b8ac-4fe5-b973-7f0d5ca1aac6","year":2020},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.023102Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:7b282c50ef5f65baadb851dcbced3d71b03f773a10ed6d0a550174db51b82ebd","observation_id":"142d4ed3-afa1-4be5-afaa-cd65ff7d8a71","resolution":{"observed_at":"2026-08-06T16:41:29.163173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.841663Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"186562a5-51a1-4102-b7af-a51a1fac35e0","year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.073829Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:11077f5f4358eee8f9c06fb52c4ac577fa25b0542025535482ebf7c4f5969cc1","observation_id":"f6407d33-1e40-4609-8f85-a7910f2b5d29","resolution":{"observed_at":"2026-08-06T16:41:28.929929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.673058Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"3517da88-5676-419c-a517-29bbcd83d324","year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.122399Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:3fb6315a8d9ef1cd014cb9051c9109a244151d395a7e2ed6445dfdf4ebdef5ec","observation_id":"04558e90-fab5-4888-abe5-73419709325b","resolution":{"observed_at":"2026-08-06T16:41:28.740936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.487160Z","title":"Exploring speech recognition, translation, and under- standing with discrete speech units: A comparative study,","venue":null,"work_id":"15c91e75-72f6-4150-92a8-09b17db1463d","year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.158395Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:2251b31b7b25083411a05c9c247ba1360dfbcd0faec32c4e97d1f439892cf527","observation_id":"d3310284-c3fd-4705-a638-f3d2805089ba","resolution":{"observed_at":"2026-08-06T16:41:28.553359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.373647Z","title":"Towards universal speech discrete tokens: A case study for ASR and TTS,","venue":null,"work_id":"77c686c2-077b-41e4-9b4c-cd7eb6baff9d","year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.198945Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:399ed78c560cb83550982fae98e13ecb9067e2727b171fc78581a51197f76986","observation_id":"0efe4163-83cf-4165-bc53-079781c11db9","resolution":{"observed_at":"2026-08-06T16:41:28.431139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.259178Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"54e0b9e4-343f-4a08-a447-92ce8f4d7651","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.267201Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:387fe54cf910863bb8cd13a383025844e9498c1226d4253b3f8442d5fd24841a","observation_id":"ac1b52f1-1ba6-4305-a834-3d58ea481eda","resolution":{"observed_at":"2026-08-06T16:41:28.306150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.132275Z","title":"High- fidelity audio compression with improved RVQGAN,","venue":null,"work_id":"3a8d2a73-25da-4983-a1a7-35d48f1f8461","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.356681Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:5ee8de4e3c7ec21aad8ad385251a7ab6daa76e87358ed39ce51ca8239f3e2317","observation_id":"648f0fb9-bcf4-496d-a021-a8bf03a59e6e","resolution":{"observed_at":"2026-08-06T16:41:28.189956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07405","last_updated":"2023-10-07T02:56:00Z","snapshot_observed_at":"2026-07-06T16:18:17.458740Z","submitted_at":"2023-09-14T03:18:24Z","title":"FunCodec: A Fundamental, Reproducible and Integrable Open-source Toolkit for Neural Speech Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07405","snapshot_observed_at":"2026-08-06T16:41:22.474153Z","title":"FunCodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.474153Z"},"links":{"cited_paper":"/paper/2309.07405","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:b21582df6edf3aad5dc8e92824e8682a6d8019c49c43c99c9aad7055b172e193","observation_id":"7fde69f3-fc30-4f7c-953f-f07cc1853b7e","resolution":{"observed_at":"2026-08-06T16:41:22.474153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-06T16:41:22.610257Z","title":"HiFi-Codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.610257Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:a5c997d5277a63624e1b0c6dce6e457a829c3870ee3f296b97adf013faddcffa","observation_id":"c46c1d72-99e2-425d-b195-235d3ac823e7","resolution":{"observed_at":"2026-08-06T16:41:22.610257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12208","last_updated":"2025-06-04T05:50:15Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:12:12Z","title":"Language-Codec: Bridging Discrete Codec Representations and Speech Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12208","snapshot_observed_at":"2026-08-06T16:41:22.680479Z","title":"Language-Codec: Reducing the gaps between discrete codec representation and speech language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.680479Z"},"links":{"cited_paper":"/paper/2402.12208","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:77e17b305f37f5b752c29418396a28e81372c7399e50c1eadc78a9be61442a1b","observation_id":"a6287e80-8a80-45e9-a36a-58b36e9745e7","resolution":{"observed_at":"2026-08-06T16:41:22.680479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-07-06T19:07:37.761860Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-06T16:41:22.809284Z","title":"WavTokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.809284Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:390e10e4ca96c8aac4f851e167152bb25c3124e55d2ba04f706264af9224d28e","observation_id":"98e1b8e5-0b0f-4ef6-9b04-5cb955d3283e","resolution":{"observed_at":"2026-08-06T16:41:22.809284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:28.002175Z","title":"Neural discrete representation learning,","venue":null,"work_id":"724381c9-4424-4bd8-a8c7-408ae58f43f1","year":2017},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:22.916480Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:43a009d29ec71ee73679e571e5fb57526109061e967896d53a5ff6e736bbdde6","observation_id":"5088cbb3-8115-47fa-81c7-5b20b0b4bde4","resolution":{"observed_at":"2026-08-06T16:41:28.056386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:27.885275Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":"198dae4d-7ef1-4bcc-9ab7-d23880d380ac","year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.018124Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:08f8419e9f66252cd544667a1bb0588f82fe10ed76cab1c2a3cb913e57d922d5","observation_id":"32b045db-4410-4c02-885d-2dceb1137dbf","resolution":{"observed_at":"2026-08-06T16:41:27.947347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:27.750402Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"cb27ee3a-472c-4148-a3a9-276dab5c77c3","year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.100796Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:e47f904982d5b0b57d55f873b5a6740fb2beba0ec5052a404af9729fc449b992","observation_id":"0c837355-3f63-45e6-b395-7b1c9bb237a2","resolution":{"observed_at":"2026-08-06T16:41:27.817479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:27.593304Z","title":"SpeechTokenizer: Unified speech tokenizer for speech large language models,","venue":null,"work_id":"35b7cfeb-608f-4e5f-977a-e9e18174c927","year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.173030Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:4d180e2a70c3826af032ebe79ce365d14795c3720fd7783b00af5872caee6a31","observation_id":"7df2ad59-42a6-45e9-9d04-283b68429eb7","resolution":{"observed_at":"2026-08-06T16:41:27.678992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00233","last_updated":"2024-11-28T12:31:04Z","snapshot_observed_at":"2026-07-06T18:08:00.410061Z","submitted_at":"2024-04-30T22:51:36Z","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00233","snapshot_observed_at":"2026-08-06T16:41:23.288503Z","title":"SemantiCodec: An ultra low bitrate semantic audio codec for general sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.288503Z"},"links":{"cited_paper":"/paper/2405.00233","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:0872a2fde544902c946b2f51a2062183a1f9ff35401d38cde076628811ae808f","observation_id":"2c8dbc01-1263-41de-a261-203542644dbe","resolution":{"observed_at":"2026-08-06T16:41:23.288503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:27.473162Z","title":"SELM: Speech enhancement using discrete tokens and language models,","venue":null,"work_id":"bac65ba8-a03d-4aba-be2e-d717941f7bcf","year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.369185Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:9fe536d04a9fb5e3ed7d06db2b18cb221710e00024bf5232d6a52c8290a82d39","observation_id":"b179fc50-6f9e-4b7e-8524-9e973e431d4e","resolution":{"observed_at":"2026-08-06T16:41:27.544450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:27.336677Z","title":"How should we extract discrete audio tokens from self-supervised models?","venue":null,"work_id":"c42a4a52-d0ef-4d7e-8425-ec843b93de9d","year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.474475Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:357791ed7154ff262cb1f233ece038128ecb36e221ad4b05d139a020996df409","observation_id":"93279da3-1f33-439e-bd5f-b487e7530aef","resolution":{"observed_at":"2026-08-06T16:41:27.406429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-06T16:41:23.555526Z","title":"DASB - discrete audio and speech benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.555526Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:5b0061a8eac18187b71281fb25009098eba367771be591942d86b1b4ff00457e","observation_id":"c3973daa-5f47-466c-8a08-417f7c839954","resolution":{"observed_at":"2026-08-06T16:41:23.555526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:27.163881Z","title":"Sequence transduction with recurrent neural networks,","venue":null,"work_id":"6d46963f-2563-4c51-9c12-e04feec62a9e","year":2012},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.647972Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:b0f8b455aebcfb29468b808617d6f7ff1f6ee300873a92e1bf88d9ef4bfbb244","observation_id":"6d6d836e-7b72-45b4-b9f3-74c4a0ef9553","resolution":{"observed_at":"2026-08-06T16:41:27.245159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:26.951076Z","title":"Exposure bias versus self- recovery: Are distortions really incremental for autoregressive text generation?","venue":null,"work_id":"09442c30-8147-4c92-8f91-3c360c96495f","year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.781090Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:80adf0714ca8bf5554b2104b9c0799bbf344c5c13892d6a1a1f9205517c35d99","observation_id":"b93cfe80-addc-44da-a5b2-a5873cf1277f","resolution":{"observed_at":"2026-08-06T16:41:27.069845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:26.783326Z","title":"Attention is all you need,","venue":null,"work_id":"b4c636d2-f02f-43f5-ae14-edf2e1ea728a","year":2017},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.869252Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:6f67974116f3bf338a94de9eafb41958131f4eb35f953b025822fe018b573818","observation_id":"aca6d0c1-f1dc-4216-b1ba-07e213de2718","resolution":{"observed_at":"2026-08-06T16:41:26.855278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:26.560496Z","title":"Investi- gating RNN-based speech enhancement methods for noise-robust text-to- speech,","venue":null,"work_id":"88187845-63d2-4709-801e-c6ed5941e77f","year":2016},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:23.957284Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:0d0bc1a7c40af718c1a1ce10f5a02ff2b9d3d792be0f3849d6b94e193ce6eb41","observation_id":"a7884187-b14d-4804-bf43-66b8232a332c","resolution":{"observed_at":"2026-08-06T16:41:26.685195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-06T16:41:24.033479Z","title":"LibriMix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.033479Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:d2278b5e7d55a0ed26899e0e9188ba87b375d4ec9ba9428eace485c43e4476f2","observation_id":"203a6940-1875-4995-8852-f38d58673943","resolution":{"observed_at":"2026-08-06T16:41:24.033479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:26.399704Z","title":"Librispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"7755f303-12cf-4ffa-a55f-d64852ed9a49","year":2015},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.124884Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:442cb607e6539b468c16b9379d9c4757ab6042b4d0ffd75ebf3bfec728c8e589","observation_id":"299f3b0b-663c-4dff-85fb-05c235bb2da1","resolution":{"observed_at":"2026-08-06T16:41:26.479563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:26.215527Z","title":"WHAM!: Extending speech separation to noisy environments,","venue":null,"work_id":"d52740b1-f85c-41a0-8347-ed18df32c610","year":2019},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.197555Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:52fac28988fcd52859832a690a424aaaf7f643bdaaaff6874ad913f9ca1c6f1f","observation_id":"9e1eed3b-10b3-4688-8958-3a9591133d2c","resolution":{"observed_at":"2026-08-06T16:41:26.303021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-06T16:41:24.295671Z","title":"V ocos: Closing the gap between time-domain and fourier- based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.295671Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:7adddaa36e76c17de78b2fe74527d1d18562ac8675bfc399cc24d1d365e795bc","observation_id":"5b2c4a59-bc6d-40f7-8ffb-889dc66184bc","resolution":{"observed_at":"2026-08-06T16:41:24.295671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:26.021674Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":"ea9f0e37-780e-4768-9c05-b3274126f6fa","year":2020},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.397498Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:f7e24c7c731fefe1e6cbf0c3a6c474dcab60fbec0604c203a81a192c7d3077d5","observation_id":"87fa2057-4541-4db6-b3fd-b883b847fb1b","resolution":{"observed_at":"2026-08-06T16:41:26.099361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:25.861052Z","title":"HiFi-GAN: generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"0dae2cdb-897c-479e-aba3-eebd3ff43a3b","year":2020},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.449009Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:ffbbfbf7c52f51c735d2586bafbc8f2ab96ee980b9b2f2995d1240de909b0461","observation_id":"7e90ddab-b579-488a-ad0d-45d1b734b7aa","resolution":{"observed_at":"2026-08-06T16:41:25.942088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:25.703849Z","title":"SDR–half-baked or well done?","venue":null,"work_id":"d9acc4a6-3890-475a-8e4d-dae461964749","year":2019},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.536302Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:12dd217cf0214d90a3aba2d8ac5c5fa61cd132c70d5fff474c6c949679a54b43","observation_id":"ed1acbb9-c6b4-4e15-bc91-36390d02c712","resolution":{"observed_at":"2026-08-06T16:41:25.773788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:25.537957Z","title":"DNSMOS P.835: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"b2960d1d-3b24-476d-9587-dd12fd99700e","year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.615550Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:8e164e49e3f043d518fdbfd65d025adab1b7ddd996acbcdfc13cf3967af0a6e2","observation_id":"fe0fb2b9-cd79-4037-a7af-6da541f5cfeb","resolution":{"observed_at":"2026-08-06T16:41:25.606167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:25.401806Z","title":"Sequential multi-frame neural beamforming for speech separation and enhancement,","venue":null,"work_id":"9723d753-120f-4872-b3b1-3206593b6abd","year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.709317Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:07533f4c5728eb4702e64c4dad193a2c18f51beb384e49d3ea3a40e63cdcc91e","observation_id":"e1429f09-8f54-45c4-a2ce-c34d2ddece51","resolution":{"observed_at":"2026-08-06T16:41:25.475436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T16:41:24.784828Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.784828Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:265bb550e334ce23d3e238d383587da0664419e6a453e85a6d3e03fcb0abaec0","observation_id":"42d7cc22-0da8-414d-a31f-95b64b67886d","resolution":{"observed_at":"2026-08-06T16:41:24.784828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-06T16:41:24.873492Z","title":"SpeechBrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.873492Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:162a94783b14aa5912adfe10633277cadb2100fa5ae674038ba5b2d1ba212079","observation_id":"90afd037-2529-483c-901a-2a3dbe73b7c4","resolution":{"observed_at":"2026-08-06T16:41:24.873492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00463","last_updated":"2024-10-16T16:13:32Z","snapshot_observed_at":"2026-08-02T19:03:34.566768Z","submitted_at":"2024-06-29T15:20:11Z","title":"Open-Source Conversational AI with SpeechBrain 1.0","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00463","snapshot_observed_at":"2026-08-06T16:41:24.944577Z","title":"Open-source conversational AI with SpeechBrain 1.0,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:24.944577Z"},"links":{"cited_paper":"/paper/2407.00463","citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:5c142c27cc615658303e504ff47e19d3f2081b7c94d371c419fa42e1290b7ae6","observation_id":"d73f1af6-a726-4f01-86c1-b4ed3f9564ad","resolution":{"observed_at":"2026-08-06T16:41:24.944577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:25.242914Z","title":"TokenSplit: Using discrete speech representations for direct, refined, and transcript-conditioned speech separation and recognition,","venue":null,"work_id":"974f0c5b-b556-4831-b0a5-4d3e3ecf0f1d","year":2023},"citing_paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:25.045627Z"},"links":{"citing_paper":"/paper/2507.12825"},"observation_digest":"sha256:83895563b6810c9c4cee908b3dd6d2d2907aa6c167bd9d8f414c5cc3f7f158e5","observation_id":"d8f5479f-9a8e-4cdd-b413-54133d9853df","resolution":{"observed_at":"2026-08-06T16:41:25.324407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12825","last_updated":"2025-07-17T06:32:22Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T16:35:20.423512Z","submitted_at":"2025-07-17T06:32:22Z","title":"Autoregressive Speech Enhancement via Acoustic Tokens"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2507.12825."}