{"as_of":"2026-08-08T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cadf1dc4395bc5d42a3e4a6b69dbe92962914a7058563a51d4537c853cebcc06","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:05:29.628800Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T07:49:20.194990Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T05:56:40.912157Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"cited_work":{"arxiv_id":"2508.02391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02391","snapshot_observed_at":"2026-07-02T05:56:40.912157Z","title":"Inference-time scaling for diffusion-based audio super-resolution.arXiv preprint arXiv:2508.02391,","venue":null,"work_id":"f5ea8c5a-82f9-48ab-ae9d-296682f58bb9","year":null},"citing_paper":{"arxiv_id":"2606.03183","last_updated":"2026-06-02T05:41:41Z","snapshot_observed_at":"2026-07-06T23:43:27.226603Z","submitted_at":"2026-06-02T05:41:41Z","title":"Inference-Time Scaling for Joint Audio-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T07:49:20.194990Z"},"links":{"cited_paper":"/paper/2508.02391","citing_paper":"/paper/2606.03183"},"observation_digest":"sha256:10a9550d1359e1f56673d66753afa1e493cf7c9f528096a4598a1f7f529c9a35","observation_id":"59270332-aa16-4238-8b3f-21ab1d15d682","resolution":{"observed_at":"2026-07-02T05:56:40.913783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.02391/citation-record","integrity":"/paper/2508.02391/integrity","json":"/paper/2508.02391/citation-record.json","paper":"/paper/2508.02391"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-06T05:05:25.719480Z","title":"Musiclm: Generating music from text.arXiv preprint arXiv:2301.11325, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:25.719480Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:705c1a68d1cad87c0ea132123bb9521249e005213f670bf460a34300ef560333","observation_id":"48db7d8e-d0e6-4105-95d2-2a4543c366b7","resolution":{"observed_at":"2026-08-06T05:05:25.719480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-06T05:05:25.801277Z","title":"Large language monkeys: Scaling inference compute with repeated sampling.arXiv preprint arXiv:2407.21787, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:25.801277Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:011755ada6046b137ec0d7a76fee75e6e5ecabe91399d4e88d74cb4253f53bf6","observation_id":"c06cd0e7-530e-43a7-9125-70cbc86b3060","resolution":{"observed_at":"2026-08-06T05:05:25.801277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:30.545485Z","title":"Musicldm: Enhancing novelty in text-to-music generation using beat-synchronous mixup strategies","venue":null,"work_id":"b54dbceb-dcc0-4d89-ad60-d34b76380235","year":2024},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:25.899510Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:2c67dbf24c02316dcbd2897a72a147fea2708a9d249732a886db25a43af38572","observation_id":"3673279d-2d10-4603-b4dc-35e525b8aeb8","resolution":{"observed_at":"2026-08-06T05:05:30.548978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:26.001366Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing.IEEE Journal of Selected Topics in Signal Processing, 16(6):1505–1518, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:26.001366Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:1a7aeb7b74cb1efdaa83f62f313ac41eaed4df749d2fbd9204404f657c24b493","observation_id":"5c9013d8-5612-40b4-bc5f-5524d676e8f3","resolution":{"observed_at":"2026-08-06T05:05:26.001366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-06T05:05:26.071505Z","title":"Qwen2-audio technical report.arXiv preprint arXiv:2407.10759, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:26.071505Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:bf1ccd156e8ebfad6119654881f534edc3f8389e7ef03b5012258cd3be9f91e2","observation_id":"95d9772d-68ba-4190-8073-53d2ae2d242e","resolution":{"observed_at":"2026-08-06T05:05:26.071505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17400","last_updated":"2024-06-21T16:45:11Z","snapshot_observed_at":"2026-08-06T10:08:54.816113Z","submitted_at":"2023-09-29T17:01:02Z","title":"Directly Fine-Tuning Diffusion Models on Differentiable Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17400","snapshot_observed_at":"2026-08-06T05:05:26.135354Z","title":"Directly fine-tuning diffusion models on differentiable rewards.arXiv preprint arXiv:2309.17400, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:26.135354Z"},"links":{"cited_paper":"/paper/2309.17400","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:c9c5ff01d17c2d119a4ec7d53fd8754751215e53088d69080f0c7f9aa0462b7e","observation_id":"518c59ab-ee3e-47fc-94d1-251728d6e871","resolution":{"observed_at":"2026-08-06T05:05:26.135354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:26.243912Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:26.243912Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:6fb4d42d19e62d8589f9275327a5e1b0f9bbed959c4f6ea9f24184fc3e153d78","observation_id":"2748de54-886e-422f-9f23-377135b90ad9","resolution":{"observed_at":"2026-08-06T05:05:26.243912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-08T00:35:10.506000Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-06T05:05:26.342534Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit.arXiv preprint arXiv:2305.11013, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:26.342534Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:fdfba1d3ffddadcdce09f4620839991abf0640c99a6cd29eec4d39e02bc339ea","observation_id":"af261e11-cd76-4626-a8df-d031500f5e34","resolution":{"observed_at":"2026-08-06T05:05:26.342534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-06T05:05:26.435388Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:26.435388Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:c5a037a6ea93afc517d247d6600f40986465ce21f740191af6b4748b7071ce69","observation_id":"152c3e68-9ab9-4f09-9092-41f59eebed06","resolution":{"observed_at":"2026-08-06T05:05:26.435388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08545","last_updated":"2022-07-01T00:35:28Z","snapshot_observed_at":"2026-08-03T19:52:32.876581Z","submitted_at":"2022-06-17T04:40:14Z","title":"NU-Wave 2: A General Neural Audio Upsampling Model for Various Sampling Rates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08545","snapshot_observed_at":"2026-08-06T05:05:26.516349Z","title":"Nu-wave 2: A general neural audio upsampling model for various sampling rates.arXiv preprint arXiv:2206.08545, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:26.516349Z"},"links":{"cited_paper":"/paper/2206.08545","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:627dcf718e65d8fa0e880d9db887ccdc181f1a0c08bb5641b7d6c54b77f6064e","observation_id":"ffaedfe7-3c15-4547-98b4-6cd388f1a795","resolution":{"observed_at":"2026-08-06T05:05:26.516349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:26.599483Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:26.599483Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:d01dfc067e9e5b07a74a3f47e1cd1e85bb09f270cb76bd9f94690b5e97a8a613","observation_id":"0c62d301-5dc5-4ce7-b698-6ed0dfdbf324","resolution":{"observed_at":"2026-08-06T05:05:26.599483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T05:05:26.697388Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:26.697388Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:2d7cbad4a5db0e6a85fe66049c7594fd37c646b5047ec7489d9179ed2c062c81","observation_id":"e50f301c-ad54-4c9a-bd2a-4f9ae10809a1","resolution":{"observed_at":"2026-08-06T05:05:26.697388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:26.799798Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis.Advances in neural information processing systems, 33:17022–17033, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:26.799798Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:3e431625c0ea99b7e773037bbab8183fc56783c91febb619fe352ebccc62ea25","observation_id":"023b804b-cf22-47f1-9408-d224b0a9f3f5","resolution":{"observed_at":"2026-08-06T05:05:26.799798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02321","last_updated":"2021-06-17T04:36:40Z","snapshot_observed_at":"2026-08-04T06:17:08.834380Z","submitted_at":"2021-04-06T06:52:53Z","title":"NU-Wave: A Diffusion Probabilistic Model for Neural Audio Upsampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02321","snapshot_observed_at":"2026-08-06T05:05:26.893661Z","title":"Nu-wave: A diffusion probabilistic model for neural audio upsampling.arXiv preprint arXiv:2104.02321, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:26.893661Z"},"links":{"cited_paper":"/paper/2104.02321","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:261915dfeb3962298f69304af3a7456c47e8ac8bfebfad26103c2c691d1d3ea5","observation_id":"014c09e7-7854-42f0-aa36-8d28a67ce2ca","resolution":{"observed_at":"2026-08-06T05:05:26.893661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:30.509799Z","title":"Noise-free optimization in early training steps for image super- resolution","venue":null,"work_id":"adc4bfe5-e4c3-424d-a6ce-6297e364c8d1","year":2024},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.012398Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:4ba42e8121dad43a6f178fb30f8e6d53a95b29fc2aaac38e2be1c2cb931d540a","observation_id":"827cfac1-42dc-47e1-b3ff-6d89c3876da1","resolution":{"observed_at":"2026-08-06T05:05:30.513791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:30.500028Z","title":"Audiosr: Versatile audio super-resolution at scale","venue":null,"work_id":"71f7f725-26b7-4b26-8b1b-64072a4b0dcb","year":2024},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.067541Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:271e6123512898355b2c2d8cc3a52bb78cdfb036588cfa388edd01aa1d54498b","observation_id":"ab16529c-e383-45ff-aaf6-4716bb46018c","resolution":{"observed_at":"2026-08-06T05:05:30.503268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-06T05:05:27.134039Z","title":"Audioldm: Text-to-audio generation with latent diffusion models.arXiv preprint arXiv:2301.12503, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.134039Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:4fddb1074d2b7ddc22b59a375ca1aec2d8d2a43ead6b921983017c781c169060","observation_id":"e0fee5c5-370f-447c-94d1-65406a061189","resolution":{"observed_at":"2026-08-06T05:05:27.134039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14941","last_updated":"2022-03-28T17:51:00Z","snapshot_observed_at":"2026-07-06T12:53:46.595393Z","submitted_at":"2022-03-28T17:51:00Z","title":"Neural Vocoder is All You Need for Speech Super-resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14941","snapshot_observed_at":"2026-08-06T05:05:27.200465Z","title":"Neural vocoder is all you need for speech super-resolution.arXiv preprint arXiv:2203.14941, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.200465Z"},"links":{"cited_paper":"/paper/2203.14941","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:6875adf5d7069f573f2db0bd52b4d2d4229a2e7daf767729e88c76c5bc52006b","observation_id":"b2bc81cf-3b27-4e90-a3f2-6b936bfc3ae5","resolution":{"observed_at":"2026-08-06T05:05:27.200465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13731","last_updated":"2021-10-05T15:52:27Z","snapshot_observed_at":"2026-07-06T11:52:12.204724Z","submitted_at":"2021-09-28T13:51:16Z","title":"VoiceFixer: Toward General Speech Restoration with Neural Vocoder","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13731","snapshot_observed_at":"2026-08-06T05:05:27.287407Z","title":"V oicefixer: Toward general speech restoration with neural vocoder.arXiv preprint arXiv:2109.13731, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.287407Z"},"links":{"cited_paper":"/paper/2109.13731","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:16b261b69d7bcfba1303a260ddf73a8bfa1a743b832f06f986c203c9432971f2","observation_id":"3e068ebb-6c8c-4317-93d5-a1dc6e83723c","resolution":{"observed_at":"2026-08-06T05:05:27.287407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:27.368077Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps.Advances in Neural Information Processing Systems, 35:5775–5787, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.368077Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:0c8ad5f80930ca3cedaea43d9c13c802da63b246d7f0e9254ec58f0603246557","observation_id":"d29ae95f-9b46-41b3-9a01-5effb4bc06e2","resolution":{"observed_at":"2026-08-06T05:05:27.368077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:27.442554Z","title":"Scaling inference time compute for diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.442554Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:524fcb3205afe0b045366af902bec2530e77419aadf0e3b0608f12e35aaec40f","observation_id":"f11eca33-6ed1-4d3b-91e2-a8800b66484e","resolution":{"observed_at":"2026-08-06T05:05:27.442554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:30.478216Z","title":"Uncertainty-driven loss for single image super-resolution.Advances in Neural Information Processing Systems, 34:16398–16409, 2021","venue":null,"work_id":"0c903121-114b-4b9a-b5b0-b03cb331768c","year":2021},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.503553Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:c219aa0ca4b2306be143ce82230ed78976c3e53507fae5abdec1e723d000777a","observation_id":"d014c32a-f416-493b-9aee-f7fc60768fa7","resolution":{"observed_at":"2026-08-06T05:05:30.481703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03544","last_updated":"2022-02-14T09:05:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-10T18:58:52Z","title":"The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03544","snapshot_observed_at":"2026-08-06T05:05:27.596743Z","title":"The effects of reward misspecification: Mapping and mitigating misaligned models.arXiv preprint arXiv:2201.03544, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.596743Z"},"links":{"cited_paper":"/paper/2201.03544","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:111d8b0a6ca575f22be8c037cfa57f03a86ece4c432f514f5b61a9aa8d7ea948","observation_id":"44414bcc-ba4b-4cb4-8992-01c2a6a7a066","resolution":{"observed_at":"2026-08-06T05:05:27.596743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:30.467104Z","title":"Esc: Dataset for environmental sound classification","venue":null,"work_id":"c2bc27b8-8aa0-4a90-b922-105a51c996af","year":2015},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.686704Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:3fe5af074d7eeeb9a9da7ab2cccfbbd342e5d18b16f01a7d9f8155135be7d74e","observation_id":"1dd6f9d9-f804-468b-800a-17064386a1f9","resolution":{"observed_at":"2026-08-06T05:05:30.471212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:27.768071Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.768071Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:2ad9efab83a69a00a0ac903b9867fcdc6a999dcb8ba8779003a672e432476fde","observation_id":"7474cf9f-2393-45cf-b483-29ddd7c48efa","resolution":{"observed_at":"2026-08-06T05:05:27.768071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-06T05:05:27.864867Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech.arXiv preprint arXiv:2006.04558, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.864867Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:529082a6f08467d58554ff0ad31178ccbb8f01795610ee9ebf3cbfbb5e91829b","observation_id":"68004d0d-dddb-45cc-b8d5-53f7c625913f","resolution":{"observed_at":"2026-08-06T05:05:27.864867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:30.449449Z","title":"Fastspeech: Fast, robust and controllable text to speech.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":"77464228-06fd-4d8c-930e-d76725b8a836","year":2019},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:27.978066Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:eb31c8c20f60f8ea660f31d98f069220501835143877e6088fe6099120a5c882","observation_id":"fd7b94e0-ed22-4fe2-941e-7ac4b062b715","resolution":{"observed_at":"2026-08-06T05:05:30.453031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:28.080199Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.080199Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:2a9d15fa1978e1a43fc8788d0d826fba6de0173498c08f85de5c618ed8392fdb","observation_id":"5bfd7618-59e3-4446-b30a-2a323305096f","resolution":{"observed_at":"2026-08-06T05:05:28.080199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-08T00:30:28.663818Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-06T05:05:28.156213Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers.arXiv preprint arXiv:2304.09116, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.156213Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:e69cdc82aaeb1322c578cc36157668c189ef776592297b9ef719f6c1afd9ca64","observation_id":"e8139e27-ff8e-4e4d-86e3-ba24bdd26ffb","resolution":{"observed_at":"2026-08-06T05:05:28.156213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T05:05:28.206753Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.206753Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:baecd25ae1d509825286d8a8b45be68c5226d9e9568c522390de3b3e91994a2e","observation_id":"da5f8c3c-c005-4d6c-a313-048a8742480e","resolution":{"observed_at":"2026-08-06T05:05:28.206753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T05:05:28.271130Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.271130Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:91ac3bb00af91c15f678cf155307900d6c576be5a72c2139e55630a92b550060","observation_id":"1bad2a83-4fc0-408d-a093-cf9fda9f040e","resolution":{"observed_at":"2026-08-06T05:05:28.271130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-06T05:05:28.360497Z","title":"Score-based generative modeling through stochastic differential equations.arXiv preprint arXiv:2011.13456, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.360497Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:4da2b9abc105901204c2ebaca304a332c4ee7ad96921906ab3c29387d8dc11f1","observation_id":"421a2ab1-1d8c-48ed-b174-a78fcbeacf4c","resolution":{"observed_at":"2026-08-06T05:05:28.360497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-08-06T05:05:28.435197Z","title":"Audiox: Diffusion transformer for anything-to-audio generation.arXiv preprint arXiv:2503.10522, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.435197Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:e1380bfe926396ad8d27e5a9e607f0577aa516ef4bd0f6b35ac4771ee4fdf07d","observation_id":"e073ebd2-2993-4a1a-ac33-63b1d0d1c62b","resolution":{"observed_at":"2026-08-06T05:05:28.435197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-06T05:05:28.514824Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound.arXiv preprint arXiv:2502.05139, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.514824Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:fd148e5112bfc6d31e63f086aac6e71acf73bdd68d30ae493134c69354094591","observation_id":"5df9d974-cdcf-4a0d-a221-71806c1dde49","resolution":{"observed_at":"2026-08-06T05:05:28.514824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:30.431636Z","title":"Towards robust speech super-resolution.IEEE/ACM transactions on audio, speech, and language processing, 29:2058–2066, 2021","venue":null,"work_id":"70b0c9a8-faba-4c03-a9a4-18725ab952c9","year":2021},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.592826Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:3d995055bc3c75c2410f6f5638a1d39a244b2e39ea69e4e812473c01bc37c132","observation_id":"c40a1b6a-db08-4293-b150-fb6fbc2bd88b","resolution":{"observed_at":"2026-08-06T05:05:30.435338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:30.420301Z","title":"Esrgan: Enhanced super-resolution generative adversarial networks","venue":null,"work_id":"a90d1348-d9b4-4471-9dec-f86fa8c835c0","year":2018},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.662941Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:3c18fff06bd8f1fcb63fc92c25a2ca42228867832d14d5916f8a1f0851846816","observation_id":"fee83341-ce77-442d-9a4f-0cef3b860c8f","resolution":{"observed_at":"2026-08-06T05:05:30.423997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:28.728175Z","title":"Difix3d+: Improving 3d reconstructions with single-step diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.728175Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:22a789162c787dfe52854ded363e0d34690a2ef922b4cac0ce12d0632259c45a","observation_id":"f7a061b5-c1ea-4829-a27e-8209352f00f1","resolution":{"observed_at":"2026-08-06T05:05:28.728175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-06T13:34:35.279373Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-06T05:05:28.821341Z","title":"Sana 1.5: Efficient scaling of training-time and inference-time compute in linear diffusion transformer.arXiv preprint arXiv:2501.18427, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.821341Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:3038d367937c55d7d5363a71b8820a3f9ded3b849cfcd9e8f75b72bf748efc8c","observation_id":"ae902334-f46f-4de1-8968-28ec79d9aa6c","resolution":{"observed_at":"2026-08-06T05:05:28.821341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:30.403236Z","title":"Flashspeech: Efficient zero-shot speech synthesis","venue":null,"work_id":"4b1e1611-58fe-4ae9-87af-606d0484c897","year":2024},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.882782Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:e185bfbc004d7f6ef01a5311e4dc685e9ac7f4ad566b15fbf3105436366c88db","observation_id":"47215184-baae-4547-bdcc-39ff7bc441d1","resolution":{"observed_at":"2026-08-06T05:05:30.406623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:30.392569Z","title":"Comospeech: One-step speech and singing voice synthesis via consistency model","venue":null,"work_id":"c45e580a-6383-4dbf-84c9-a743246e5acc","year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:28.955893Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:4cede8f5ef4f9fcacb0e50b08bf95998f0516c3244348a7adacabb7284a3b175","observation_id":"f925a107-9820-4bfc-ba08-83c3990f4c71","resolution":{"observed_at":"2026-08-06T05:05:30.395990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-07T17:49:42.104594Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-06T05:05:29.031835Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis.arXiv preprint arXiv:2502.04128, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:29.031835Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:9def184b77c8ca85f7ffaeb872cf869ed92384ad292239cfbd6811e54f4ba92e","observation_id":"751e1231-605c-4b79-85a1-fd9ae8a5d8d5","resolution":{"observed_at":"2026-08-06T05:05:29.031835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.05236","last_updated":"2021-08-23T11:33:02Z","snapshot_observed_at":"2026-07-06T10:48:07.645786Z","submitted_at":"2021-03-09T05:47:43Z","title":"GAN Vocoder: Multi-Resolution Discriminator Is All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.05236","snapshot_observed_at":"2026-08-06T05:05:29.114926Z","title":"Gan vocoder: Multi-resolution discriminator is all you need.arXiv preprint arXiv:2103.05236, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:29.114926Z"},"links":{"cited_paper":"/paper/2103.05236","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:f1c3224fdbac0268d1251272830292b8f891b86f11a690c020a973934df6ba62","observation_id":"98348ee1-b86b-421a-afa6-e30ad42aff16","resolution":{"observed_at":"2026-08-06T05:05:29.114926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:30.382363Z","title":"Conditioning and sampling in variational diffusion models for speech super-resolution","venue":null,"work_id":"0c4f43c1-152d-420c-8cfa-f9365bfb48da","year":2023},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:29.190217Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:1202a24373176eb0e7970f9f7888a127193a58a04f5c7fa2ee3470d0cb80c437","observation_id":"f9876195-b761-4a36-9249-f6796d051134","resolution":{"observed_at":"2026-08-06T05:05:30.385784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:30.241987Z","title":"Uncertainty-guided perturbation for image super-resolution diffusion model","venue":null,"work_id":"0b1f94d8-a146-4d65-83d5-de16e5df72be","year":2025},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:29.256313Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:f119f8d2cb35f76fcc7793e58473d8e04f7bca7eec559352dc77bc3084dd7629","observation_id":"f1ca83c3-1f35-4bbc-a6ef-48de064b3670","resolution":{"observed_at":"2026-08-06T05:05:30.364653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:29.324913Z","title":"Flashvideo: Flowing fidelity to detail for efficient high-resolution video generation.arXiv preprint arXiv:2502.05179, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:29.324913Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:b3e0c435796166fdb206b220c439f2313c387f76cc03f814b42784e2c8700c2b","observation_id":"c1d3dd04-2823-48ce-95c4-3e9ca5587cd6","resolution":{"observed_at":"2026-08-06T05:05:29.324913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:05:29.441344Z","title":"Inference-time scaling of diffusion models through classical search.arXiv preprint arXiv:2505.23614, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:29.441344Z"},"links":{"citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:2f9b7c1aa1233e1cef97fad9b5a4704f27aea15844057efad21c09f94c0aea5b","observation_id":"e6725dd0-fa92-42f8-93ce-be202f53b31d","resolution":{"observed_at":"2026-08-06T05:05:29.441344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-05T06:11:45.068217Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20690","snapshot_observed_at":"2026-08-06T05:05:29.628800Z","title":"In-context edit: Enabling instructional image editing with in-context generation in large scale diffusion transformer.arXiv preprint arXiv:2504.20690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T05:05:29.628800Z"},"links":{"cited_paper":"/paper/2504.20690","citing_paper":"/paper/2508.02391"},"observation_digest":"sha256:d477eca59806fe4677e8dbddfda8ce33cdaf41a9299aa39c17febe18c1ea2c93","observation_id":"8d5bd33c-6925-46c0-856b-49e492e51a65","resolution":{"observed_at":"2026-08-06T05:05:29.628800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.02391","last_updated":"2025-08-04T13:17:49Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T02:50:04.116531Z","submitted_at":"2025-08-04T13:17:49Z","title":"Inference-time Scaling for Diffusion-based Audio Super-resolution"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2508.02391."}