{"as_of":"2026-08-23T02:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c75f5d4af3c1649965e0792829b8bf25899ac39b424e871b516f4ffb6fdf431","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":70,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:27:56.712678Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":54,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2305.02463","last_updated":"2023-05-03T23:59:13Z","snapshot_observed_at":"2026-08-12T18:09:04.196531Z","submitted_at":"2023-05-03T23:59:13Z","title":"Shap-E: Generating Conditional 3D Implicit Functions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T15:32:06.563955Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2305.02463"},"observation_digest":"sha256:8704d078ddbf4681e8dcea7306bca1170af1b3e2bf496995b071ab4000898f35","observation_id":"efeb8960-e2a4-4923-a911-adfcd1d04b37","resolution":{"observed_at":"2026-05-16T15:32:06.794611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-21T19:19:25.551780Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:bf8d437b40559d3c5db1bfe4b5580699fe7bf49475a43ec08ab807f944957cd7","observation_id":"ead98b7d-9584-4ad0-a34c-abdfe64ff9ed","resolution":{"observed_at":"2026-05-16T07:07:57.868936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-21T19:19:25.551780Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T07:07:57.800866Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2306.12925"},"observation_digest":"sha256:2715b6afb4c6629cd90132c8fb4424dcfb353629588faf1f3dcb3ccd6dea8745","observation_id":"9a1c68fa-3bca-4550-bce5-b4e39b77681c","resolution":{"observed_at":"2026-05-16T07:07:57.841399Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:b325a26b0932d4ff295bd50c87ff048ffd1880794a8cef09f59970e56734993e","observation_id":"32b56a7a-2b0d-42f3-9330-44fc7b8f3be1","resolution":{"observed_at":"2026-05-11T14:16:24.998932Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2411.12363","last_updated":"2026-04-20T02:56:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-19T09:23:22Z","title":"DGSNA: Dynamic Generative Scene-based Noise Addition method","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T17:43:47.086524Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2411.12363"},"observation_digest":"sha256:ba01dd30b3dfd0c6f6ea0433097caa91ec9180893fc05857026850ee5834ac32","observation_id":"369c61ec-e708-4499-9a1c-23c07b26287f","resolution":{"observed_at":"2026-05-23T17:45:46.276353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-12T04:41:58.803381Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.803381Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:4583428cdfeeb2ac125a95927e5fdccd26ec3170afa0ac3537a57c69767c887f","observation_id":"04286985-c320-4d5c-b573-024e5a7f7941","resolution":{"observed_at":"2026-08-12T04:41:58.803381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-11T17:17:49.425590Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09168","last_updated":"2024-12-12T10:55:57Z","snapshot_observed_at":"2026-08-19T16:13:49.463844Z","submitted_at":"2024-12-12T10:55:57Z","title":"YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T17:17:49.425590Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2412.09168"},"observation_digest":"sha256:13a97e0d855db08b6efcc91dfc562d4b12154b4f1de5b24e293fe524ed8bb5b1","observation_id":"bdbf71f0-986e-453b-b4e8-fc928c46b627","resolution":{"observed_at":"2026-08-11T17:17:49.425590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-11T16:48:46.561780Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09789","last_updated":"2024-12-13T02:07:21Z","snapshot_observed_at":"2026-08-18T22:46:24.721751Z","submitted_at":"2024-12-13T02:07:21Z","title":"SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T16:48:46.561780Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2412.09789"},"observation_digest":"sha256:0e860c1c1eff1d53c0df28eea04f2f3c28e75346e4f91c469145aca64f5604d6","observation_id":"0a677f8b-f682-4499-a7d2-9425e63bd858","resolution":{"observed_at":"2026-08-11T16:48:46.561780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-11T15:43:00.930103Z","title":"Audiogen: Textually guided audio gen- eration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10768","last_updated":"2024-12-14T09:36:10Z","snapshot_observed_at":"2026-08-19T19:38:43.886895Z","submitted_at":"2024-12-14T09:36:10Z","title":"VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:43:00.930103Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2412.10768"},"observation_digest":"sha256:3b0739afcd0ea5e31754035a561db46c92932e85d513b53ecd7e8c0be336926c","observation_id":"75b0328f-621c-491d-a3ed-870cadf9102b","resolution":{"observed_at":"2026-08-11T15:43:00.930103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-11T14:59:02.040138Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-21T08:28:48.041857Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":207,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:02.040138Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:bfbbf05f325998155484560fa6347fe387445282878092c5266b27c699eedf09","observation_id":"52c9a419-3ef7-4f45-a1da-78829d2f1d5c","resolution":{"observed_at":"2026-08-11T14:59:02.040138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-11T00:45:19.799997Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-19T08:38:11.019942Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.799997Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:4540c10a146a3f3695dda83bb86bf57a3c57be732b4ce87165f4fd0e67cadecf","observation_id":"40aa2056-1b35-4ee2-bf0d-1365d5d79202","resolution":{"observed_at":"2026-08-11T00:45:19.799997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-10T14:10:43.632039Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.15598","last_updated":"2025-01-26T16:52:27Z","snapshot_observed_at":"2026-08-15T08:42:02.413456Z","submitted_at":"2025-01-26T16:52:27Z","title":"Diffusion Generative Modeling for Spatially Resolved Gene Expression Inference from Histology Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:10:43.632039Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2501.15598"},"observation_digest":"sha256:79257143138caa98a6b7f07279392ea9cc0de3c781470bfc2323b3792cb89c07","observation_id":"648dee04-b661-4c3c-8687-9cad3c27db25","resolution":{"observed_at":"2026-08-10T14:10:43.632039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-10T00:02:26.192304Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-18T15:31:43.763605Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.192304Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:2aa79848d1e8beab7dc0c0a7624b744209b01331f32387acb6cb285bc384a66c","observation_id":"0423f0dc-9b3c-48f9-9046-375a6fed13ca","resolution":{"observed_at":"2026-08-10T00:02:26.192304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-08T20:12:29.493933Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05130","last_updated":"2025-07-29T07:31:59Z","snapshot_observed_at":"2026-08-21T07:59:48.661314Z","submitted_at":"2025-02-07T18:02:47Z","title":"Latent Swap Joint Diffusion for 2D Long-Form Latent Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T20:12:29.493933Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2502.05130"},"observation_digest":"sha256:ad85bbe616297eeb193d1ba80b2731a574a894f56229b09777a1c8acdc8291a9","observation_id":"3f174bf9-4794-4b90-9a4b-16154374c1d1","resolution":{"observed_at":"2026-08-08T20:12:29.493933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-09T11:46:23.120195Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05215","last_updated":"2025-02-04T18:49:50Z","snapshot_observed_at":"2026-08-16T12:20:29.079131Z","submitted_at":"2025-02-04T18:49:50Z","title":"Watermarking across Modalities for Content Tracing and Generative AI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T11:46:23.120195Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2502.05215"},"observation_digest":"sha256:1cd04e3a06895b6c06301118b1ad4bf4cabd7bac72f7ba604a69d748e3033ed0","observation_id":"ea6fdf99-c86f-4979-9a02-e9f0147347e9","resolution":{"observed_at":"2026-08-09T11:46:23.120195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T15:36:46.052253Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-16T21:38:58.815524Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:46.052253Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:5d1bc45fbb736134398bdc7625c2edc183efc020c3c52dbbba58da75129184e3","observation_id":"7a95b9ff-de8a-497d-8d58-def212839c4e","resolution":{"observed_at":"2026-08-07T15:36:46.052253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T15:09:54.545341Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-18T13:11:50.987345Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.545341Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:ab8feeab027ab8995b3cba9446b0d3ded9eba8a0948bd62c221b791acedb8076","observation_id":"abc09efc-c13d-4be5-8260-8f0b94acdb03","resolution":{"observed_at":"2026-08-07T15:09:54.545341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T14:19:50.833721Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.833721Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:92a7d6cc4d196e242e05fda9fd17dfe9ef7b02479c1a3a12dce85cbc0a55c360","observation_id":"ebbb6bb1-5a6c-4a0b-8b3c-05f49645f4d4","resolution":{"observed_at":"2026-08-07T14:19:50.833721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T12:29:39.487610Z","title":"Audiogen: Textu- ally guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-14T10:04:40.808126Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.487610Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:60b190eb7ca06a3d14252a9b8ff9f1f4336ceb60dca8687b76dcd085bd2a2048","observation_id":"dd6f89eb-99a1-4a4f-b2c3-2541d03efd3c","resolution":{"observed_at":"2026-08-07T12:29:39.487610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T12:12:18.396585Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00375","last_updated":"2025-05-31T04:03:38Z","snapshot_observed_at":"2026-08-20T16:04:52.171151Z","submitted_at":"2025-05-31T04:03:38Z","title":"RPRA-ADD: Forgery Trace Enhancement-Driven Audio Deepfake Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:18.396585Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2506.00375"},"observation_digest":"sha256:e9402f948974d55328fddf32f43d034101b017eb168f9379c61f5b47a761397f","observation_id":"0beca6d6-5409-4aff-8881-f8ef0005ec92","resolution":{"observed_at":"2026-08-07T12:12:18.396585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T05:36:15.600823Z","title":"Audiogen: Textually guided audio gen- eration","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07575","last_updated":"2025-06-09T09:20:20Z","snapshot_observed_at":"2026-08-19T00:01:34.914966Z","submitted_at":"2025-06-09T09:20:20Z","title":"Uncertainty-o: One Model-agnostic Framework for Unveiling Uncertainty in Large Multimodal Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:36:15.600823Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2506.07575"},"observation_digest":"sha256:e10ea7d580c8e4edb7b7200538f501250ef46488de919c805c849cc1a7897028","observation_id":"4e14ef2e-2a4b-44a6-abc1-7ad47759d318","resolution":{"observed_at":"2026-08-07T05:36:15.600823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T04:45:18.835009Z","title":"Audio- gen: Textually guided audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09874","last_updated":"2025-07-10T19:47:47Z","snapshot_observed_at":"2026-08-17T02:21:03.433032Z","submitted_at":"2025-06-11T15:43:08Z","title":"UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:45:18.835009Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2506.09874"},"observation_digest":"sha256:7d4c2cb585ac05ea00fbf746f37754e0e3e4402026fbcfee67a82de5a1be76d2","observation_id":"dd1ab871-4070-40d1-bc54-9ce02b7be156","resolution":{"observed_at":"2026-08-07T04:45:18.835009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-06T21:36:10.880679Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23869","last_updated":"2025-06-30T14:00:14Z","snapshot_observed_at":"2026-08-22T23:35:40.331449Z","submitted_at":"2025-06-30T14:00:14Z","title":"Scaling Self-Supervised Representation Learning for Symbolic Piano Performance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:10.880679Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2506.23869"},"observation_digest":"sha256:ec75670feed47fbc1b60a49847fc6e9830d68473d9075c28fe22ac18d16eb706","observation_id":"62f42dd3-c0c1-4d0c-9e21-5dd102e3b288","resolution":{"observed_at":"2026-08-06T21:36:10.880679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-06T21:19:53.373430Z","title":"AudioGen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-19T11:40:39.134615Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.373430Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:258206484bb7878fe088d8dcb8a20a93a60b2e9a7db722f12dcfcd09ea7a4916","observation_id":"22a2f17d-6983-401a-9a7e-2026ed796308","resolution":{"observed_at":"2026-08-06T21:19:53.373430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-06T20:47:36.020784Z","title":"Christian Ledig, Lucas Theis, Ferenc Huszar, Jose Caballero, Andrew Cunningham, Alejandro Acosta, Andrew Aitken, Alykhan Tejani, Johannes Totz, Zehan Wang, and Wenzhe Shi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01886","last_updated":"2025-07-02T16:56:09Z","snapshot_observed_at":"2026-08-10T02:48:20.758043Z","submitted_at":"2025-07-02T16:56:09Z","title":"Improving GANs by leveraging the quantum noise from real hardware","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:36.020784Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2507.01886"},"observation_digest":"sha256:fb207f7c54ae92147e7beebfcb76b5c032ce8bd64b6edd52bfab16eb6e8022b9","observation_id":"fd74fb05-b515-4cb9-b2c6-78d2cfbc1ee7","resolution":{"observed_at":"2026-08-06T20:47:36.020784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-06T19:20:44.308451Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05894","last_updated":"2025-07-08T11:32:02Z","snapshot_observed_at":"2026-08-20T04:31:56.485508Z","submitted_at":"2025-07-08T11:32:02Z","title":"MusiScene: Leveraging MU-LLaMA for Scene Imagination and Enhanced Video Background Music Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:20:44.308451Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2507.05894"},"observation_digest":"sha256:d0cc0672258e9e94bc08ebe90a16e040c3d1e00eb07ee2726f6e12af36640d3e","observation_id":"cb3f769f-f12c-4815-b75c-438ab21490ca","resolution":{"observed_at":"2026-08-06T19:20:44.308451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-06T14:04:00.770124Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19835","last_updated":"2025-07-26T07:12:02Z","snapshot_observed_at":"2026-08-20T13:37:29.496677Z","submitted_at":"2025-07-26T07:12:02Z","title":"SonicGauss: Position-Aware Physical Sound Synthesis for 3D Gaussian Representations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:04:00.770124Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2507.19835"},"observation_digest":"sha256:366bcfe9290f93ebe89d06bc4a163c8ddb672e43f3bef8a63e510e134756a7e8","observation_id":"fec46f35-ef4d-44e9-9579-51fb1c6d56bd","resolution":{"observed_at":"2026-08-06T14:04:00.770124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-06T06:04:29.899392Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-20T08:17:17.638415Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.899392Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:c2edb2ce4248c5d85f55da825b1e99d2488675fe9ad19cf85e827f6f609319b9","observation_id":"30c34803-a6cb-4e46-873f-06920348492f","resolution":{"observed_at":"2026-08-06T06:04:29.899392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T22:54:55.037230Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.037230Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:c7ed4a86308e9d5d099ae940ac954754febe03b7e4ea7866fddb7cb22dae8b86","observation_id":"1d21322c-37df-411b-af3b-985273ffd8b9","resolution":{"observed_at":"2026-08-05T22:54:55.037230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T19:04:26.400685Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13633","last_updated":"2025-08-19T08:47:34Z","snapshot_observed_at":"2026-08-15T07:14:40.543915Z","submitted_at":"2025-08-19T08:47:34Z","title":"Text2Weight: Bridging Natural Language and Neural Network Weight Spaces","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T19:04:26.400685Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2508.13633"},"observation_digest":"sha256:758e07805398e25dd39885a419faa51adfcf43cbc6b7fed0c3ae29dcde1566a4","observation_id":"4353d9b0-39b4-408c-8ec1-a990bf116fc7","resolution":{"observed_at":"2026-08-05T19:04:26.400685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T18:59:49.892351Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13644","last_updated":"2025-08-19T08:54:58Z","snapshot_observed_at":"2026-08-22T08:16:31.262935Z","submitted_at":"2025-08-19T08:54:58Z","title":"Conflicting Scores, Confusing Signals: An Empirical Study of Vulnerability Scoring Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T18:59:49.892351Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2508.13644"},"observation_digest":"sha256:1b668a2508fd7901477f31894d9f30399347fd9e465dcc452167a06dc5bdf615","observation_id":"c9a47c8d-e2c4-48d8-97b0-bf3fb57334d4","resolution":{"observed_at":"2026-08-05T18:59:49.892351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T15:44:06.458359Z","title":"Audio- gen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19603","last_updated":"2025-08-27T06:36:49Z","snapshot_observed_at":"2026-08-17T07:38:25.056524Z","submitted_at":"2025-08-27T06:36:49Z","title":"CompLex: Music Theory Lexicon Constructed by Autonomous Agents for Automatic Music Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:06.458359Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2508.19603"},"observation_digest":"sha256:d3c4440a7e51f64f7e248bb66573fdf66594b9c0fbbc26ac50ca5dc5942f8c8d","observation_id":"699117b6-2f64-4149-9fd1-165eaaf6c739","resolution":{"observed_at":"2026-08-05T15:44:06.458359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T05:01:36.737476Z","title":"AudioGen: Textually Guided Audio Generation.ArXiv, 2209.15352, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-15T05:55:38.630847Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.737476Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:c0113b98c8efa75d040f7aae76acd365d5601bd562b5ed668edaadde677feae2","observation_id":"a1260ad0-06c3-4bd2-87ee-c4e0c0a3b362","resolution":{"observed_at":"2026-08-05T05:01:36.737476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-04T20:54:12.105923Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08283","last_updated":"2025-09-10T04:56:40Z","snapshot_observed_at":"2026-08-17T10:50:52.606453Z","submitted_at":"2025-09-10T04:56:40Z","title":"Segment Transformer: AI-Generated Music Detection via Music Structural Analysis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:54:12.105923Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2509.08283"},"observation_digest":"sha256:27c8446e80916b16279058fb0a201188973e7cc18e40d0b4f2759cceac7a9c02","observation_id":"a4ad2945-d372-4a1a-bec9-ff1e605254a2","resolution":{"observed_at":"2026-08-04T20:54:12.105923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-04T21:25:26.909866Z","title":"AudioGen: Textually Guided Audio Generation.ArXiv, 2209.15352, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-15T13:12:57.491333Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.909866Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:ac7b33d17d040810811c5d24cf1d0f7ed40b6e848b2c87016917fe4d12359ace","observation_id":"b2ed3cc5-127e-42e8-a0e2-220132449bde","resolution":{"observed_at":"2026-08-04T21:25:26.909866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2509.23727","last_updated":"2026-04-09T14:19:05Z","snapshot_observed_at":"2026-08-13T22:24:46.691730Z","submitted_at":"2025-09-28T08:12:43Z","title":"AudioMoG: Guiding Audio Generation with Mixture-of-Guidance","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-18T13:10:18.700497Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2509.23727"},"observation_digest":"sha256:f9a29ad0e1de19eaebd2b92e858eedc5591125199992b6c2aa4fc835765d4968","observation_id":"cdc799a6-0e8a-482a-ad42-19bc116d3940","resolution":{"observed_at":"2026-05-18T13:11:23.852477Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2511.04776","last_updated":"2026-05-19T11:11:39Z","snapshot_observed_at":"2026-08-15T02:15:05.242652Z","submitted_at":"2025-11-06T19:52:02Z","title":"Quantifying the Climate Risk of Generative AI: Region-Aware Carbon Accounting with G-TRACE and the AI Sustainability Pyramid","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T00:33:28.444546Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2511.04776"},"observation_digest":"sha256:8b5e9e1fc6e7c93efc77007bb9032cb3f5b3281ddfa02a339d9db455014b6f69","observation_id":"8fba2990-c8a4-471d-be22-abe733918f0e","resolution":{"observed_at":"2026-05-18T00:35:32.539216Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2511.04776","last_updated":"2026-05-19T11:11:39Z","snapshot_observed_at":"2026-08-15T02:15:05.242652Z","submitted_at":"2025-11-06T19:52:02Z","title":"Quantifying the Climate Risk of Generative AI: Region-Aware Carbon Accounting with G-TRACE and the AI Sustainability Pyramid","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T18:54:54.484299Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2511.04776"},"observation_digest":"sha256:8065436428f8f969a0b115f449c7d7217d194edd9bc817b59aad825e8e18c5e6","observation_id":"ab5f087a-00b7-403a-a110-52256ddb52ad","resolution":{"observed_at":"2026-05-21T18:55:29.709153Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2512.01537","last_updated":"2026-05-18T17:15:31Z","snapshot_observed_at":"2026-08-15T21:40:35.377632Z","submitted_at":"2025-12-01T11:06:38Z","title":"Two-Dimensional Quantization for Geometry-Aware Audio Coding","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-21T18:16:51.486807Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2512.01537"},"observation_digest":"sha256:1bdfc83745aa83236dd8ac81fc9fc40bbc53b1a0a2a3416564cf70dd46f090e8","observation_id":"434f0367-9f12-4872-b9ea-5c08903e7b22","resolution":{"observed_at":"2026-05-21T18:20:29.171279Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2512.04847","last_updated":"2026-04-17T12:33:14Z","snapshot_observed_at":"2026-08-15T07:22:50.080075Z","submitted_at":"2025-12-04T14:30:58Z","title":"Language Models as Semantic Teachers: Post-Training Alignment for Medical Audio Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T01:08:02.914421Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2512.04847"},"observation_digest":"sha256:b5f36d4a56b533d33e548423d3a03e3c006f1c9b784aecae4612e37ebace7aa2","observation_id":"e3eb7a0d-662c-4de7-b6b1-ad3bb442c4fb","resolution":{"observed_at":"2026-05-17T01:08:47.353495Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2601.02731","last_updated":"2026-04-29T02:44:11Z","snapshot_observed_at":"2026-08-11T16:06:15.387767Z","submitted_at":"2026-01-06T05:49:41Z","title":"Omni2Sound: Towards Unified Video-Text-to-Audio Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T17:25:38.591071Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2601.02731"},"observation_digest":"sha256:ad72000a4a7b2a3042625e659c0cf98386b07ad1e546a96e5766d4ae00419b18","observation_id":"5bc56e09-265e-4bf7-a799-5dc6ab6f22e4","resolution":{"observed_at":"2026-05-16T17:28:10.039177Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-03T07:06:33.234587Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21402","last_updated":"2026-07-02T10:34:29Z","snapshot_observed_at":"2026-08-15T08:15:52.699676Z","submitted_at":"2026-01-29T08:40:37Z","title":"SemanticAudio: Audio Generation and Editing in Semantic Space","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T07:06:33.234587Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2601.21402"},"observation_digest":"sha256:34a101e888cbf4016bc7e1fda022a20d8358cd92012d59af0fc5f60ad7d05caa","observation_id":"b6bc8e9f-6678-40cd-be8f-813d203bcdbe","resolution":{"observed_at":"2026-08-03T07:06:33.234587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2603.19857","last_updated":"2026-04-18T07:29:42Z","snapshot_observed_at":"2026-08-11T06:30:51.892484Z","submitted_at":"2026-03-20T11:19:29Z","title":"FoleyDirector: Fine-Grained Temporal Steering for Video-to-Audio Generation via Structured Scripts","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T07:35:14.257562Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2603.19857"},"observation_digest":"sha256:ce51fbe8631169a7f01d16d21a8422bd060ba55242d69f60a8755cfb0bd625bf","observation_id":"061b5dad-dfc2-42d9-bc6e-291fe3375a92","resolution":{"observed_at":"2026-05-15T07:39:50.489770Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2604.01929","last_updated":"2026-04-29T10:54:09Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T11:49:00Z","title":"Woosh: A Sound Effects Foundation Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T20:51:08.144573Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2604.01929"},"observation_digest":"sha256:f68cae6ee9abb5a151c8e411a51f3cc87ef2c57a49f2d83a22fc31a3e0eec2d9","observation_id":"654bf81e-37a0-47ea-8326-c82201367047","resolution":{"observed_at":"2026-05-13T20:53:15.846934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-08-20T22:45:03.058855Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:d0f4aa4057e307a5aad970a49dddab936cb3e68ce89e90064c966b6b1938777d","observation_id":"97460d33-4d3c-4005-8e54-fe74b6302896","resolution":{"observed_at":"2026-05-10T23:40:51.743617Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2604.06489","last_updated":"2026-04-07T21:47:55Z","snapshot_observed_at":"2026-08-15T14:12:51.726091Z","submitted_at":"2026-04-07T21:47:55Z","title":"Language-Guided Multimodal Texture Authoring via Generative Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T18:36:18.143344Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2604.06489"},"observation_digest":"sha256:6920198e7106aa02b444401beb7f61d90f7942118aec1fe9ed7f0689b1c1e985","observation_id":"9a480914-74fe-46ee-a9de-7aff9550d9dc","resolution":{"observed_at":"2026-05-11T00:20:52.077448Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2604.10708","last_updated":"2026-04-26T21:06:11Z","snapshot_observed_at":"2026-08-11T03:18:41.519430Z","submitted_at":"2026-04-12T16:08:20Z","title":"Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:32.711587Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2604.10708"},"observation_digest":"sha256:885620f6fd7b8b77a39d0dd6576e7129e87f3fadf488a3b71a071a77ed671ee3","observation_id":"15c4c702-8f2f-457e-aed8-38a4f0da5e68","resolution":{"observed_at":"2026-05-11T10:26:01.867051Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2605.04547","last_updated":"2026-05-06T06:54:00Z","snapshot_observed_at":"2026-08-11T13:48:17.888197Z","submitted_at":"2026-05-06T06:54:00Z","title":"Stage-adaptive audio diffusion modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T17:21:34.140699Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2605.04547"},"observation_digest":"sha256:57044a11ecb682228cc9b32e4d9c348e824bc6c994c9377cd96dca9da0ff995d","observation_id":"fa340242-55c2-4653-9b71-0126a681a4cb","resolution":{"observed_at":"2026-05-11T17:41:06.334790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-08-15T01:04:50.804421Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T12:25:52.847432Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:e1d00f358d17f80fd64a2c0f33ab4d57f6d74f6226783e1f6a354b80d5068530","observation_id":"6a672a1a-68e4-4080-ac5a-2e8f03a5d69c","resolution":{"observed_at":"2026-05-11T19:16:08.621406Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-08-15T01:04:50.804421Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T23:14:32.494076Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:6b90b0ae4c7d4cdcaec7a9a7c0227697c64c760b21846cb3550e83c3c8837784","observation_id":"c41a3266-46f2-4bac-b4ee-d0f84219272b","resolution":{"observed_at":"2026-06-30T23:15:07.860845Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2605.09971","last_updated":"2026-05-11T04:26:51Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T04:26:51Z","title":"HapticLDM: A Diffusion Model for Text-to-Vibrotactile Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:11:29.782569Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2605.09971"},"observation_digest":"sha256:34b4dcd0388a9b35e91532331464d4b4b420da7a87316bac13ccea352d74bd70","observation_id":"6587fdd1-bbcd-4cfe-8f7d-8d60d6f629d7","resolution":{"observed_at":"2026-05-12T06:31:28.213391Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-15T08:00:46.166668Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:df5daf5fa36943b0d579b278fcb9824eb8b2be89eb4227e7c0679038e8c8608f","observation_id":"311d23eb-a810-499c-a0a7-241c32dba0f2","resolution":{"observed_at":"2026-05-20T07:38:09.638265Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2605.29675","last_updated":"2026-05-28T09:35:59Z","snapshot_observed_at":"2026-07-06T23:39:05.858969Z","submitted_at":"2026-05-28T09:35:59Z","title":"From Prompts to Context: An Ontology-Driven Framework for Human-Generative AI Collaboration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T05:49:07.096866Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2605.29675"},"observation_digest":"sha256:48b651cb3c2586961cf393168c4ae4d61c97031e7810c7922588ebe0eec065f1","observation_id":"0e1f002f-0aad-40d4-8a01-d0b593e31204","resolution":{"observed_at":"2026-06-29T05:53:08.898141Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2606.05522","last_updated":"2026-06-03T23:53:27Z","snapshot_observed_at":"2026-07-06T23:45:33.157370Z","submitted_at":"2026-06-03T23:53:27Z","title":"Exploring LLMs for South Asian Music Understanding and Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T04:20:55.786682Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2606.05522"},"observation_digest":"sha256:1c3498115502c9fa849b96eab0bc77080e050c5de7708b84e78227940f2800dc","observation_id":"f989c01c-5fc3-4c94-af0e-9f6dd47e0fc0","resolution":{"observed_at":"2026-07-02T11:16:53.544994Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-12T18:53:54.003220Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:ec0997f94465bf7d7e1c15fe99913cabc882837a49147a917bcde0ec36e04fbe","observation_id":"f9cb6270-4fc0-4fba-8be1-7451caaa2f12","resolution":{"observed_at":"2026-07-03T03:27:35.639979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2606.12555","last_updated":"2026-07-02T19:10:03Z","snapshot_observed_at":"2026-07-12T14:16:32.755376Z","submitted_at":"2026-06-10T18:06:27Z","title":"AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-27T08:04:48.283908Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2606.12555"},"observation_digest":"sha256:9056ada8515319044cb4bb80c4dc280b4df7b8e539ada2515af4fc1c9e1fc0ca","observation_id":"215416f7-9adc-446b-bb67-eef53a16984e","resolution":{"observed_at":"2026-07-03T13:28:18.759153Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2606.23064","last_updated":"2026-06-22T09:13:57Z","snapshot_observed_at":"2026-08-21T00:57:29.870939Z","submitted_at":"2026-06-22T09:13:57Z","title":"STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T07:26:28.527338Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2606.23064"},"observation_digest":"sha256:fd400f9f9e84e0e1677dbc3715078914c5023c340deea6e7595d9ae5f1934719","observation_id":"e27c08c9-823f-49c2-8761-251e7f0b3cad","resolution":{"observed_at":"2026-07-04T11:59:50.507838Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2606.23080","last_updated":"2026-06-22T09:30:02Z","snapshot_observed_at":"2026-08-17T00:39:07.624929Z","submitted_at":"2026-06-22T09:30:02Z","title":"AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T07:24:01.244733Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2606.23080"},"observation_digest":"sha256:7d02832f6734d3f6a8e4d939d7051e51da2e321dc82175cf1465e6502d98c872","observation_id":"f812876c-b041-46ca-b479-de859aacba17","resolution":{"observed_at":"2026-07-04T11:59:50.928711Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2606.29480","last_updated":"2026-06-28T16:17:37Z","snapshot_observed_at":"2026-08-12T13:07:53.997567Z","submitted_at":"2026-06-28T16:17:37Z","title":"DTM-Codec: Dynamic Token Masking for VFR Speech Coding with Efficient Boundary Selection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T02:10:08.691873Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2606.29480"},"observation_digest":"sha256:29935108e73d0f73f73a8fe608323a10d0c3c77972e7eb4f3de4f916118beff8","observation_id":"e81382e8-ef1a-4f3f-928f-ca254135b169","resolution":{"observed_at":"2026-06-30T02:14:11.507162Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-19T04:43:08.967042Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:c99833323dbb787da7a23b7395c9b754c314637297de65a27962d7116651f97e","observation_id":"577fed90-655a-45b5-8f7e-3dd254524b18","resolution":{"observed_at":"2026-07-08T00:04:22.697609Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-12T23:08:16.716964+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2209.15352 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-19T04:43:08.967042Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:f2c9eddd33b138be14af793f8c3d56f557cf219b29bcb2e50e85507392e9f65c","observation_id":"a63fd72a-20b8-4faa-9bc0-8e0282303d1e","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-02T05:32:41.406290Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13330","last_updated":"2026-07-14T23:22:27Z","snapshot_observed_at":"2026-08-17T23:25:14.367050Z","submitted_at":"2026-07-14T23:22:27Z","title":"Efficient Text-to-Audio Generation via Pruning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:32:41.406290Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2607.13330"},"observation_digest":"sha256:a9d326b5ca9ba3bb383ec375cc22cdca52f80c033b14d28fd9c9240cb6cda82d","observation_id":"6c63dd82-4e28-4882-8ed9-21601106bb7b","resolution":{"observed_at":"2026-08-02T05:32:41.406290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-02T05:19:56.888125Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13408","last_updated":"2026-07-26T03:09:03Z","snapshot_observed_at":"2026-08-18T21:57:48.057403Z","submitted_at":"2026-07-15T03:13:06Z","title":"Improving Text-to-Audio Instruction Following via Fine-Grained Feedback from Audio-Aware Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:19:56.888125Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2607.13408"},"observation_digest":"sha256:bc4caec115d875b48f56bfe84e077380322b01ee24aed66072f0e362d71728be","observation_id":"83e62017-cf58-492c-8725-d771dc9ac622","resolution":{"observed_at":"2026-08-02T05:19:56.888125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-07-30T11:48:49.491314Z","title":"Kushal Lakhotia, Evgeny Kharitonov, Wei-Ning Hsu, Yossi Adi, Adam Polyak, Benjamin Bolte, Tu-Anh Nguyen, Jade Copet, Alexei Baevski, Adelrahman Mohamed, and Emmanuel Dupoux","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-08-17T17:56:26Z","snapshot_observed_at":"2026-08-23T01:42:38.593304Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.491314Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:591662e7013b022b117bf82b69c19d54d65d4ec57a5a6ef7a78dedc0203b1b56","observation_id":"0b2fa850-bb71-4998-8e76-cabf201c68f4","resolution":{"observed_at":"2026-07-30T11:48:49.491314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T13:43:18.217158Z","title":"DOI 10.48550/arXiv.2209.15352","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03742","last_updated":"2026-08-04T14:36:34Z","snapshot_observed_at":"2026-08-08T01:12:36.890782Z","submitted_at":"2026-08-04T14:36:34Z","title":"AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:43:18.217158Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2608.03742"},"observation_digest":"sha256:54ebc590c8299c6b61ccdb4c196073507c739e1ab0f92855dc83b4c40badafee","observation_id":"c0610341-293a-487a-a718-a52ed9be0656","resolution":{"observed_at":"2026-08-05T13:43:18.217158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-15T14:42:59.721245Z","title":"arXiv preprint arXiv:2209.15352 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04479","last_updated":"2026-08-05T06:06:54Z","snapshot_observed_at":"2026-08-19T07:42:04.360814Z","submitted_at":"2026-08-05T06:06:54Z","title":"AudioScape-TTA: A Structured Soundscape Benchmark for Fine-Grained Text-to-Audio Evaluation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T14:42:59.721245Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2608.04479"},"observation_digest":"sha256:81ac4197c2808a2d65f2719637587d0632120273b3616d26fa7da945e11de905","observation_id":"bb6fb21a-5080-4518-a440-6a289ae14ec0","resolution":{"observed_at":"2026-08-15T14:42:59.721245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-12T00:10:20.659246Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08349","last_updated":"2026-08-08T22:09:52Z","snapshot_observed_at":"2026-08-18T16:33:51.929554Z","submitted_at":"2026-08-08T22:09:52Z","title":"Dramarrator: Object-Based Audio Editing for Audio Drama Production from Books","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T00:10:20.659246Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2608.08349"},"observation_digest":"sha256:6b65984e78cfb18205d634d53e58ad4613cbbe9815a87e6ac788897126d332d1","observation_id":"437ad67b-7280-40ed-9e1b-59ef718edfb1","resolution":{"observed_at":"2026-08-12T00:10:20.659246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-11T14:31:00.785155Z","title":"arXiv preprint arXiv:2209.15352 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09593","last_updated":"2026-08-10T13:27:09Z","snapshot_observed_at":"2026-08-18T03:31:06.137908Z","submitted_at":"2026-08-10T13:27:09Z","title":"MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T14:31:00.785155Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2608.09593"},"observation_digest":"sha256:adf14931ae56df951b2f353e7393a4bbf503ce24626b30190afc0daf240ceba9","observation_id":"561c049e-96ad-480d-9eca-3549fced96a6","resolution":{"observed_at":"2026-08-11T14:31:00.785155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-16T00:27:56.712678Z","title":"arXiv preprint arXiv:2209.15352 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11913","last_updated":"2026-08-12T10:45:26Z","snapshot_observed_at":"2026-08-19T08:16:17.040535Z","submitted_at":"2026-08-12T10:45:26Z","title":"HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:56.712678Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2608.11913"},"observation_digest":"sha256:03873427b2e6510943a32bc184eca91dc6afd958911c7ef2eac1a20104f2c64a","observation_id":"2e7819bb-46a5-4095-844b-9aa85c87df2c","resolution":{"observed_at":"2026-08-16T00:27:56.712678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-15T19:59:27.748642Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-22T06:39:10.386092Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.748642Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:2dd896ea926ff908c78845308af4ab8b1a63ab6eeafd2e4343f92a9a2bcc9588","observation_id":"207557e9-24ec-461c-bbb6-0a732429bc3f","resolution":{"observed_at":"2026-08-15T19:59:27.748642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2209.15352/citation-record","integrity":"/paper/2209.15352/integrity","json":"/paper/2209.15352/citation-record.json","paper":"/paper/2209.15352"},"outbound":[],"paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 70 inbound Pith citation observations for arXiv:2209.15352."}