{"as_of":"2026-08-23T17:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:36f761a6da1a7326ef593d03f98e27f5e21ef4dc60c95fa50ad2de3537cfcd1d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:59:27.912849Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.552662Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-12T10:46:23.581165Z","title":"Taming data and transformers for audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18953","last_updated":"2024-11-28T06:50:13Z","snapshot_observed_at":"2026-08-21T11:14:56.479942Z","submitted_at":"2024-11-28T06:50:13Z","title":"AudioSetCaps: An Enriched Audio-Caption Dataset using Automated Generation Pipeline with Large Audio and Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:46:23.581165Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2411.18953"},"observation_digest":"sha256:591e6964bdf94e3a7e0197f4dfbaed5cba56d964190c71c196dc54fdb931ba19","observation_id":"ca402966-e9f1-484e-8561-a58021840176","resolution":{"observed_at":"2026-08-12T10:46:23.581165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":"2406.19388","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-07-08T00:04:22.552662Z","title":"Taming data and transformers for audio generation","venue":"cs.SD","work_id":"1b6fb07a-4dff-4086-ae8f-3e16903cf206","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:06050eb67898395360dbfa9f97c4f535367cf025806f2a16ccf9a7a0b31482e4","observation_id":"62c79e91-2061-402c-a6bf-6f4d89e674ee","resolution":{"observed_at":"2026-05-23T07:42:43.395027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-11T11:38:08.253139Z","title":"Taming data and transformers for audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15191","last_updated":"2025-03-10T18:30:39Z","snapshot_observed_at":"2026-08-18T16:26:34.884540Z","submitted_at":"2024-12-19T18:57:21Z","title":"AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:08.253139Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2412.15191"},"observation_digest":"sha256:082b5d79057639d949f3f762ed8cc1c8e1dc8de77e49357cfae3b2d83676d2f2","observation_id":"1077e4aa-094b-498e-829b-60aa55850084","resolution":{"observed_at":"2026-08-11T11:38:08.253139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-11T11:35:57.685416Z","title":"Taming data and transformers for audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-18T13:59:15.022742Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:35:57.685416Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2412.15322"},"observation_digest":"sha256:31931bd2320dfadb048c476a87df4c0d9b00c05acaf2f4c34d3412231f8e221d","observation_id":"5a5f7d87-ce14-433a-bbdb-35d30f0e8508","resolution":{"observed_at":"2026-08-11T11:35:57.685416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-11T00:45:19.734377Z","title":"Taming data and transformers for audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19351","last_updated":"2025-06-30T23:24:17Z","snapshot_observed_at":"2026-08-19T08:38:11.019942Z","submitted_at":"2024-12-26T21:13:12Z","title":"ETTA: Elucidating the Design Space of Text-to-Audio Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T00:45:19.734377Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2412.19351"},"observation_digest":"sha256:f65d682ee29f776afd3b8a53da9ea6f99c9a6053177b40b4eeabd70e79e025fb","observation_id":"252aef73-a3a0-4225-925a-957d08ea0c46","resolution":{"observed_at":"2026-08-11T00:45:19.734377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-10T20:14:24.048855Z","title":"Taming data and transformers for audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-16T11:13:43.640159Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:24.048855Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2501.09291"},"observation_digest":"sha256:95a90a17beebe3e060af95f428eeaa39b1a616eefdb2066837dbaef30284cbe7","observation_id":"6c6ef354-ca3f-4c70-aeca-c4fac11cd4bd","resolution":{"observed_at":"2026-08-10T20:14:24.048855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-10T14:36:19.677624Z","title":"Taming data and transformers for audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-19T23:01:24.892193Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-10T14:36:19.677624Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2501.15177"},"observation_digest":"sha256:4582707a5bffe9f43972d9337b23225330a1de96a4d66a65ba996d98635711a7","observation_id":"d902a54c-7d83-4850-9ab8-e32caae0b953","resolution":{"observed_at":"2026-08-10T14:36:19.677624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-07T12:01:34.136572Z","title":"Taming data and transformers for audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00800","last_updated":"2025-06-01T03:01:16Z","snapshot_observed_at":"2026-08-14T13:12:39.137855Z","submitted_at":"2025-06-01T03:01:16Z","title":"CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:34.136572Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2506.00800"},"observation_digest":"sha256:dcd56a344710e2a61638b4161bf29b4f6d92883b95247b6bd6875bf2c8ba8e39","observation_id":"ab9921c6-7f27-4813-8fdb-9715031c8ae5","resolution":{"observed_at":"2026-08-07T12:01:34.136572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":"2406.19388","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-07-08T00:04:22.552662Z","title":"Taming data and transformers for audio generation","venue":"cs.SD","work_id":"1b6fb07a-4dff-4086-ae8f-3e16903cf206","year":2024},"citing_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-13T04:37:51.305325Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T01:03:15.183360Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2510.01284"},"observation_digest":"sha256:b903f5f2e36ce33e25f8b348b74e19179f8a86e1688f56c244c2fdd19b65ed7b","observation_id":"8b22a89d-8fc6-43e5-8b3d-9b9d56dbf6b8","resolution":{"observed_at":"2026-05-17T01:03:15.228449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":"2406.19388","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-07-08T00:04:22.552662Z","title":"Taming data and transformers for audio generation","venue":"cs.SD","work_id":"1b6fb07a-4dff-4086-ae8f-3e16903cf206","year":2024},"citing_paper":{"arxiv_id":"2601.02731","last_updated":"2026-04-29T02:44:11Z","snapshot_observed_at":"2026-08-11T16:06:15.387767Z","submitted_at":"2026-01-06T05:49:41Z","title":"Omni2Sound: Towards Unified Video-Text-to-Audio Generation","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T17:25:38.591071Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2601.02731"},"observation_digest":"sha256:bb663b4520d198273491712448ba6e86fcb895c363fd4e319a3341d14dd9a4f8","observation_id":"eb5cee6c-a1db-4e75-8407-12de4b8c8d7c","resolution":{"observed_at":"2026-05-16T17:28:10.003947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":"2406.19388","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-07-08T00:04:22.552662Z","title":"Taming data and transformers for audio generation","venue":"cs.SD","work_id":"1b6fb07a-4dff-4086-ae8f-3e16903cf206","year":2024},"citing_paper":{"arxiv_id":"2605.31530","last_updated":"2026-06-02T14:24:03Z","snapshot_observed_at":"2026-08-14T05:36:12.019199Z","submitted_at":"2026-05-29T16:43:07Z","title":"UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T20:44:20.190064Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2605.31530"},"observation_digest":"sha256:d400f7b0037aef1d96fb44689e960350f29adf8b6d103f7a6f5d7d77b5c540bf","observation_id":"c4e9a791-cfa6-48e6-9005-ff73212cf8d5","resolution":{"observed_at":"2026-06-28T20:52:37.898279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":"2406.19388","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-07-08T00:04:22.552662Z","title":"Taming data and transformers for audio generation","venue":"cs.SD","work_id":"1b6fb07a-4dff-4086-ae8f-3e16903cf206","year":2024},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-19T04:43:08.967042Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:579912ee6aaf86ebb3a4668aeb1125b191816449f6bc8c2c62069dcdcd5e2b5a","observation_id":"aa35f474-cc64-41c6-bfd8-57ea10a6eed6","resolution":{"observed_at":"2026-07-08T00:04:22.554191Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2406.19388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-19T04:43:08.967042Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:0dbb4310761418b413f1bd2b74c66b0cf7445b5cde39d494537b693c9d8fd675","observation_id":"0f5bfcfd-e825-45fc-ad6d-8e3cd4f569ec","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19388","snapshot_observed_at":"2026-08-15T19:59:27.912849Z","title":"Taming data and transformers for audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12951","last_updated":"2026-08-13T08:27:22Z","snapshot_observed_at":"2026-08-22T06:39:10.386092Z","submitted_at":"2026-08-13T08:27:22Z","title":"VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:59:27.912849Z"},"links":{"cited_paper":"/paper/2406.19388","citing_paper":"/paper/2608.12951"},"observation_digest":"sha256:4846da75c385c8502e18b653cd7192e191efe18bcc203635a541d9458df980d5","observation_id":"0098b65d-aebd-41f6-95de-d804a312b0de","resolution":{"observed_at":"2026-08-15T19:59:27.912849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.19388/citation-record","integrity":"/paper/2406.19388/integrity","json":"/paper/2406.19388/citation-record.json","paper":"/paper/2406.19388"},"outbound":[],"paper":{"arxiv_id":"2406.19388","last_updated":"2025-04-16T17:40:22Z","latest_version":4,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T13:38:58.476435Z","submitted_at":"2024-06-27T17:58:54Z","title":"Taming Data and Transformers for Audio Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2406.19388."}