{"as_of":"2026-08-09T06:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61630a6d818d19c6b102ffe4f8a2f64b89d026f1342f919f78735cc0746d6c7b","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T11:48:49.534136Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23811/citation-record","integrity":"/paper/2607.23811/integrity","json":"/paper/2607.23811/citation-record.json","paper":"/paper/2607.23811"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-07-30T11:48:49.415516Z","title":"Musiclm: Generating music from text.arXiv preprint arXiv:2301.11325,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.415516Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:ec7821dd03b21f45d4b10c7d10fd1050086477c41e574fc5f3b6d9a46ab78328","observation_id":"e21cd542-a294-44d8-934b-7df81d036d3f","resolution":{"observed_at":"2026-07-30T11:48:49.415516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T11:48:49.477289Z","title":"com/deepmind-media/gemma/gemma-2-report.pdf","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.477289Z"},"links":{"citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:732b7f4192bbcd9333c68aa52199a73d81be3deff833c2acc0a0f4da35386782","observation_id":"b2454572-4142-42e8-ad1e-0287e74a13f0","resolution":{"observed_at":"2026-07-30T11:48:49.477289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-07-30T11:48:49.491314Z","title":"Kushal Lakhotia, Evgeny Kharitonov, Wei-Ning Hsu, Yossi Adi, Adam Polyak, Benjamin Bolte, Tu-Anh Nguyen, Jade Copet, Alexei Baevski, Adelrahman Mohamed, and Emmanuel Dupoux","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.491314Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:0e6c9b1662c470369e0f45c0d6153f4952efb962016533890e2ece1a9b0f3c35","observation_id":"0b2fa850-bb71-4998-8e76-cabf201c68f4","resolution":{"observed_at":"2026-07-30T11:48:49.491314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.10139","last_updated":"2022-03-03T23:05:26Z","snapshot_observed_at":"2026-08-09T02:42:25.691730Z","submitted_at":"2021-10-19T17:48:12Z","title":"Chunked Autoregressive GAN for Conditional Waveform Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.10139","snapshot_observed_at":"2026-07-30T11:48:49.506021Z","title":"AaronvandenOord, SanderDieleman, HeigaZen, KarenSimonyan, OriolVinyals, AlexGraves, NalKalchbrenner, An- drewSenior, andKorayKavukcuoglu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.506021Z"},"links":{"cited_paper":"/paper/2110.10139","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:5f449f47c66dd20f06a15ffc53267cd712769aafdfe8b36b7ca7036bc356a536","observation_id":"2df537a7-7fdf-4fd9-b00b-816a65adfb4b","resolution":{"observed_at":"2026-07-30T11:48:49.506021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T11:48:49.509573Z","title":"Librispeech: An asr corpus based on public domain audio books.2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 5206–5210,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.509573Z"},"links":{"citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:2404381630cd174132445665f177b476ba6e639c324a010cd3e9a18deb9da496","observation_id":"c6ed2877-ded8-4e06-8f7b-fca3dad09f39","resolution":{"observed_at":"2026-07-30T11:48:49.509573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T11:48:49.515999Z","title":"Eval- uating speech features with the minimal-pair abx task: analysis of the classical mfc/plp pipeline","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.515999Z"},"links":{"citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:ec5fb9e5450e0c4a7b3760dc936aa465af27e3e8c8642401ca8f2190ea5a5227","observation_id":"e00c8b65-13fc-4ce9-9780-4d7741398f39","resolution":{"observed_at":"2026-07-30T11:48:49.515999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-07-30T11:48:49.522615Z","title":"Haibin Wu, Naoyuki Kanda, Sefik Emre Eskimez, and Jinyu Li","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.522615Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:e7f853dbdeab2693fd8c07ece53423e3983ce24e4e8d838e4d48201a1313b471","observation_id":"26515f14-db05-481a-9502-5459cc5e519f","resolution":{"observed_at":"2026-07-30T11:48:49.522615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18803","last_updated":"2025-04-27T16:37:28Z","snapshot_observed_at":"2026-08-06T16:58:49.935180Z","submitted_at":"2024-11-27T23:07:52Z","title":"TS3-Codec: Transformer-Based Simple Streaming Single Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18803","snapshot_observed_at":"2026-07-30T11:48:49.526693Z","title":"Haibin Wu, Bach Viet Do, Naveen Suda, Julian Chan, C R Madhavan, Gene-Ping Yang, Yi-Chiao Wu, Naoyuki Kanda, Yossef Adi, Xin Lei, Yue Liu, Florian Metze, and Yuzong Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.526693Z"},"links":{"cited_paper":"/paper/2411.18803","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:63063db2f860880e6dd118db1db9515102f9e038b28f943861877f61aea5d74c","observation_id":"e039e130-9fc9-4b33-afdd-ef05a5bfedf3","resolution":{"observed_at":"2026-07-30T11:48:49.526693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T11:48:49.530312Z","title":"Biao Zhang and Rico Sennrich","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.530312Z"},"links":{"citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:468eb3118c4aac80465ce537618d9ebacfe55bf51ea86270f4bc0d68973150f8","observation_id":"4592ddbd-ab3b-4b57-befd-05ec2ee93192","resolution":{"observed_at":"2026-07-30T11:48:49.530312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07467","last_updated":"2019-10-16T16:44:22Z","snapshot_observed_at":"2026-08-08T08:22:25.110228Z","submitted_at":"2019-10-16T16:44:22Z","title":"Root Mean Square Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07467","snapshot_observed_at":"2026-07-30T11:48:49.534136Z","title":"AppleandtheApplelogoaretrademarksofAppleInc.,registeredintheU.S.andothercountriesandregions","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.534136Z"},"links":{"cited_paper":"/paper/1910.07467","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:929ad20a175a080b6c1d7d02f73e256d446bd65aaa314caf8c9b083820bb5c0f","observation_id":"20638a92-3a74-4b07-9690-c58b1bf289b6","resolution":{"observed_at":"2026-07-30T11:48:49.534136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T11:48:49.512738Z","title":"William Peebles and Saining Xie","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.512738Z"},"links":{"citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:ec843172eb37781af041f2a8ae00fe9458790f0ff251c9c928cecc2c3b7e00e0","observation_id":"389770ee-ba4d-44f0-a81c-53148c577d9f","resolution":{"observed_at":"2026-07-30T11:48:49.512738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-07-30T11:48:49.487060Z","title":"Diffwave: A versatile diffusion model for audio synthesis.arXiv preprint arXiv:2009.09761,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.487060Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:0f159a6349861938976963dc138a94ada8d6ba6fbd7a0e8a45ab0a5252662ebe","observation_id":"c827519a-d409-4fad-8d7a-dbe151ca1f16","resolution":{"observed_at":"2026-07-30T11:48:49.487060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08352","last_updated":"2021-07-14T07:32:49Z","snapshot_observed_at":"2026-08-08T00:23:46.265688Z","submitted_at":"2019-04-17T16:38:31Z","title":"MOSNet: Deep Learning based Objective Assessment for Voice Conversion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08352","snapshot_observed_at":"2026-07-30T11:48:49.502742Z","title":null,"venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.502742Z"},"links":{"cited_paper":"/paper/1904.08352","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:996291c3addc16dbc2ed92aed57d6faa5bf83277c586b0f5449c6906c6367436","observation_id":"6e732adf-c477-44e6-9729-136ae39cab44","resolution":{"observed_at":"2026-07-30T11:48:49.502742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-07-30T11:48:49.434595Z","title":"Zalán Borsos, RaphaëlMarinier, DamienVincent, Eugene Kharitonov, Olivier Pietquin, Matt Sharifi, DominikRoblek, Olivier Teboul, David Grangier, Marco Tagliasacchi, et al","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.434595Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:9e484a8431a835399773d3ba6864a4d5a3f31cca0b31b965d48e4027677c5df9","observation_id":"5e9069ad-1b4b-4e21-b525-e7855bc98209","resolution":{"observed_at":"2026-07-30T11:48:49.434595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01192","last_updated":"2021-09-09T22:36:33Z","snapshot_observed_at":"2026-08-08T22:26:07.425583Z","submitted_at":"2021-02-01T21:41:40Z","title":"Generative Spoken Language Modeling from Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01192","snapshot_observed_at":"2026-07-30T11:48:49.494905Z","title":"Doyup Lee, Chiheon Kim, Saehoon Kim, Minsu Cho, and Wook-Shin Han","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.494905Z"},"links":{"cited_paper":"/paper/2102.01192","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:e66ce0002b4edc6ea3cff25c517078ad50960504ba113d279800e33da18e48da","observation_id":"d0504c5b-bbea-47b6-a591-41777f8f3a14","resolution":{"observed_at":"2026-07-30T11:48:49.494905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-07-30T11:48:49.461058Z","title":"Zach Evans, Julian Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.461058Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:1a3268c2cd0e118b7767b7a68c79a4850767473bc920973acf67d1ee8581dc1f","observation_id":"7db42bbe-1d03-45a6-8ca0-0af55c59bc70","resolution":{"observed_at":"2026-07-30T11:48:49.461058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-07-30T11:48:49.443774Z","title":"Moshi: a speech-text foundation model for real-time dialogue.arXiv preprint arXiv:2410.00037,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.443774Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:3660491ec644c1f07e8c2af3b2a12f4b72c098b4cbc508627294cb6be9ba3f88","observation_id":"221537d4-7c66-4dc0-9ef5-949e125132b2","resolution":{"observed_at":"2026-07-30T11:48:49.443774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-07-30T11:48:49.452676Z","title":"Jukebox: A generative model for music.arXiv preprint arXiv:2005.00341,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.452676Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:e3782e508f34b9b8c3a6d6d59dbda756253e6c25ea3dccef40cc3837c03cbc45","observation_id":"7b841039-5eab-4ab0-9bfe-e88eaec1fdba","resolution":{"observed_at":"2026-07-30T11:48:49.452676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02086","last_updated":"2025-06-02T21:33:43Z","snapshot_observed_at":"2026-08-02T20:26:29.728788Z","submitted_at":"2025-01-03T20:19:14Z","title":"Instruction-Following Pruning for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02086","snapshot_observed_at":"2026-07-30T11:48:49.482980Z","title":"Nal Kalchbrenner, Erich Elsen, Karen Simonyan, Seb Noury, Norman Norm, Eamonn Lockhart, Florian Stimberg, Aaron van den Oord, Sander Dieleman, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.482980Z"},"links":{"cited_paper":"/paper/2501.02086","citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:f3af6b5707ca919f6c5b6d007e28e0c6ec1bd5a19fc72f2246e7b59bdc233503","observation_id":"9f2d315c-a744-44a2-b2e3-7246a5d8d1a6","resolution":{"observed_at":"2026-07-30T11:48:49.482980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T11:48:49.469480Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-30T11:48:49.469480Z"},"links":{"citing_paper":"/paper/2607.23811"},"observation_digest":"sha256:60441b4d5e2f6198a72933d62764fffbfa3bb273e137ba9801eca1e93ec77ed7","observation_id":"9a48891d-6705-4140-862d-2ffea9aa6f28","resolution":{"observed_at":"2026-07-30T11:48:49.469480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23811","last_updated":"2026-07-26T19:20:01Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-05T02:59:42.567093Z","submitted_at":"2026-07-26T19:20:01Z","title":"Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2607.23811."}