{"as_of":"2026-08-24T03:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4abd41033bcc79a482c58b1290c15106567995fcce1417c40d8f7e10d0fbb2bd","coverage":[{"denominator":105,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:52:01.555758Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09834/citation-record","integrity":"/paper/2507.09834/integrity","json":"/paper/2507.09834/citation-record.json","paper":"/paper/2507.09834"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:51:57.664745Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:57.664745Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:001ef837a5bc1cc95416d19ebf4cac8d9f0a1533d307af3cb932e7c6fb4a27b8","observation_id":"6efcc7bb-fd54-4224-a267-64c4ce3397a6","resolution":{"observed_at":"2026-08-06T17:51:57.664745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07520","last_updated":"2022-01-19T10:45:38Z","snapshot_observed_at":"2026-08-16T17:27:23.345212Z","submitted_at":"2022-01-19T10:45:38Z","title":"CM3: A Causal Masked Multimodal Model of the Internet","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07520","snapshot_observed_at":"2026-08-06T17:51:57.735481Z","title":"B., Ross, C., Karpukhin, V., Xu, H., Goyal, N., Okhonko, D., Joshi, M., Ghosh, G., Lewis, M., and Zettlemoyer, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:57.735481Z"},"links":{"cited_paper":"/paper/2201.07520","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:87bb6fa01789571539114f14dbc4bbf14efa60e20744862582a4aafa3f4f4a97","observation_id":"9131fc63-07e3-43cb-bcc0-cad32f8bc346","resolution":{"observed_at":"2026-08-06T17:51:57.735481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-20T13:40:28.954978Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-06T17:51:57.869593Z","title":"I., Borsos, Z., Engel, J., Verzetti, M., Caillon, A., Huang, Q., Jansen, A., Roberts, A., Tagliasacchi, M., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:57.869593Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:f0e7a99af9f6b99769ecd49f0923042193acc11fec34725962c4e513407789a8","observation_id":"5eadcefa-5bb4-4fdf-adb0-1228793942dc","resolution":{"observed_at":"2026-08-06T17:51:57.869593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:57.960959Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:57.960959Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:b42fd1167474c8979f3c98d1163d45fdda793ad5400a22c463d948852ff04a1a","observation_id":"ec3a40b2-dd06-421a-9477-24893b4722c3","resolution":{"observed_at":"2026-08-06T17:51:57.960959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:58.067440Z","title":"Efficient self-supervised learning with contextualized target representations for vision, speech and language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:58.067440Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:3c0ac0b6dd23aecfcfb166bdf789c1df250bd6d7197d9166e201ab993e917133","observation_id":"715f549e-44f1-4cc4-a35e-0f9fa46f1566","resolution":{"observed_at":"2026-08-06T17:51:58.067440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14255","last_updated":"2022-07-28T17:40:47Z","snapshot_observed_at":"2026-08-12T15:32:23.741504Z","submitted_at":"2022-07-28T17:40:47Z","title":"Efficient Training of Language Models to Fill in the Middle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.14255","snapshot_observed_at":"2026-08-06T17:51:58.202849Z","title":"Efficient training of language models to fill in the middle","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:58.202849Z"},"links":{"cited_paper":"/paper/2207.14255","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:9e28dce373c72aadcb52977e002def7f3572c8550dea7ae6ef70e30c917899ae","observation_id":"b8a76069-7860-4bd9-a30a-cff8034fcfcc","resolution":{"observed_at":"2026-08-06T17:51:58.202849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:58.295858Z","title":"P., Whitman, B., and Lamere, P","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:58.295858Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:f4a30f331bc4eb34f082103de37f8cdbc8b9e03d1afa6bea0af401aa33f5d9a8","observation_id":"7f9b02ea-6eba-4047-a7cf-d49fc1af0048","resolution":{"observed_at":"2026-08-06T17:51:58.295858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:58.418812Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:58.418812Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:05e784515e3c023095ecdee3b7a65ad3edb6d695fc792578021a3868d3b3f5f8","observation_id":"58732254-db4c-4a72-8c85-4cb1156ea639","resolution":{"observed_at":"2026-08-06T17:51:58.418812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:58.544942Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:58.544942Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:ec00d1e9ad62d9871d891a7c52302c5d269f8813786a26d7a857e7fd8af2eaec","observation_id":"a87379fc-ca28-4c30-8bb9-9a4481c3d8ea","resolution":{"observed_at":"2026-08-06T17:51:58.544942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:58.639495Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:58.639495Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:da914b965e78cf0a286290787c2036ac16e21c0176825e80278b658cd7c6314b","observation_id":"aaf64e81-db4b-4585-b04a-93435b88f6b2","resolution":{"observed_at":"2026-08-06T17:51:58.639495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:58.766911Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:58.766911Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:51549f669a825b1a72e206276b2608a358923381a7be0c2270f4083ac5cf1f52","observation_id":"5938745a-d9dc-4696-b80f-a42e344aa918","resolution":{"observed_at":"2026-08-06T17:51:58.766911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:58.854783Z","title":"Generative pretraining from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:58.854783Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:e3e21d98c77136757f09fdda3b5f76fafb28d57bda92bd34c5fd455e1d81c7e7","observation_id":"0dab3047-7493-492d-8d44-2bfb8ae35f75","resolution":{"observed_at":"2026-08-06T17:51:58.854783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:58.920337Z","title":"W., Sutton, C., Gehrmann, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:58.920337Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:ff1e0b8c7edcf823b4263a30f2cc1cf41a62cd26785ccc21d1ecefe82b857c28","observation_id":"7e35d0c2-c434-4d90-855a-f74abadef30e","resolution":{"observed_at":"2026-08-06T17:51:58.920337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:58.987922Z","title":"W., Hou, L., Longpre, S., Zoph, B., Tay, Y., Fedus, W., Li, Y., Wang, X., Dehghani, M., Brahma, S., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:58.987922Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:b30228bbee97a240b7ec31204359f05994d055d2848cb0cfc89dcad1bb39aed9","observation_id":"e0552ca2-b1a0-41c8-a4f0-1dcccc2dfe7f","resolution":{"observed_at":"2026-08-06T17:51:58.987922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:59.056092Z","title":"and Glass, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:59.056092Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:e6798174c6af156f51835d5520e4ef46d30e386c9a4ebd30e9c5c18ac5018d5b","observation_id":"7d30dc78-bdca-4754-a901-4879d7d66824","resolution":{"observed_at":"2026-08-06T17:51:59.056092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:59.118450Z","title":"Simple and controllable music generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:59.118450Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:bf3e5bd1147e8fbb48523cf9388b656b63a8ba13d7085097f4817198c6490785","observation_id":"20e9f689-e8a1-4938-948c-8a3a583cc133","resolution":{"observed_at":"2026-08-06T17:51:59.118450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:59.214401Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:59.214401Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:51660f796213c8ca29bf04f1d553143da0923b421d91b2545ea61cfe01987324","observation_id":"c0728646-8a08-451b-bdb5-631127642ae8","resolution":{"observed_at":"2026-08-06T17:51:59.214401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-1136","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Audio retrieval with wavtext5k and clap training","venue":null,"work_id":"d74a16ee-ce70-491c-abdf-5b0ad4e8f8c7","year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:59.310297Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:695de4a9602557fee0394e79489388d50eae748950e1969ba2268f3801370e34","observation_id":"d63710d3-093a-46e3-8555-74a752d6a4c4","resolution":{"observed_at":"2026-08-06T17:52:02.088576Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:59.385684Z","title":"and Nichol, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:59.385684Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:d14818a138def005190f48ca4e3bb5085ee286d2155ff24d28789af6433431c0","observation_id":"213abee5-84e7-458f-a2c4-21200944714c","resolution":{"observed_at":"2026-08-06T17:51:59.385684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:59.490738Z","title":"Clotho: An audio captioning dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:59.490738Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:46b58170db5dc29dc1acc2d95177e44ad5a7464da6772bbf9f26ace6f715ec6b","observation_id":"86dd9ebc-d423-403c-b9f0-432b20f2fe09","resolution":{"observed_at":"2026-08-06T17:51:59.490738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:59.563010Z","title":"M., Tong, S., Lepikhin, D., Xu, Y., Krikun, M., Zhou, Y., Yu, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:59.563010Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:ee720fe73679298e4d6642229c8dbf83e9640b3adbb1538d162039a25db21412","observation_id":"5a20690b-a4b4-4e22-a24f-7390abb4eff4","resolution":{"observed_at":"2026-08-06T17:51:59.563010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:59.648011Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:59.648011Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:d8139964f1a20808e0c951cb774c5f093122d3be0cbee14086b20b38cd0ac088","observation_id":"6a587f63-3347-40fb-864e-b652040bcd7f","resolution":{"observed_at":"2026-08-06T17:51:59.648011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:59.785341Z","title":"Freesound datasets: a platform for the creation of open audio datasets","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:59.785341Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:b71a25dd5cd654dd54aaf889694de3a88fa44bc07acb160c5e78074652eccffe","observation_id":"5fb8f1fe-e39f-4862-a122-58780d30709b","resolution":{"observed_at":"2026-08-06T17:51:59.785341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:59.829775Z","title":"Fsd50k: an open dataset of human-labeled sound events","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:59.829775Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:976162f2a320ea7b39c6ec8ce55443ab1dc61267e0d04a86d53cecad47fd35a3","observation_id":"10c0bb35-aae1-4d7d-8d14-3a01deb5a65f","resolution":{"observed_at":"2026-08-06T17:51:59.829775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:59.937178Z","title":"Incoder: A generative model for code infilling and synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:59.937178Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:bee598eb5b6576d8070a1e16a5ae89140bd3397f21506ea16d87017868380c7a","observation_id":"88837d40-0691-4c63-a2e7-954918da5a11","resolution":{"observed_at":"2026-08-06T17:51:59.937178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:00.050091Z","title":"F., Ellis, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:00.050091Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:0f043d11f5bdde1cc9ded8f2aaa4c49e89112187fcc1bc341596cd9f35c9675f","observation_id":"efe1e0fb-4689-4be9-b974-764f913243a3","resolution":{"observed_at":"2026-08-06T17:52:00.050091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-16T15:38:16.919337Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-06T17:52:00.192473Z","title":"Text-to-audio generation using instruction-tuned LLM and latent diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:00.192473Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:072edcab1604f9e5b21c8d2548eca7aba3fc84c5e3321f4e3979bcb2cb31a017","observation_id":"8cc0151b-43c8-4f68-a72c-50d218cdacc8","resolution":{"observed_at":"2026-08-06T17:52:00.192473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:00.328565Z","title":"Ast: Audio spectrogram transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:00.328565Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:abe31cc09e5b4b47f08ea0802b0a4b7b951a72194362bf1466b565e915f10e01","observation_id":"dea4d46f-e350-4a40-8e83-0d8002684e3e","resolution":{"observed_at":"2026-08-06T17:52:00.328565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:00.412842Z","title":"Prompttts: Controllable text-to-speech with text descriptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:00.412842Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:b57a709826c04a967a1f42820b48aa8f18dcfad265114c9804e44391956df1eb","observation_id":"404fb916-edf8-46f0-8a86-0ecae1f35969","resolution":{"observed_at":"2026-08-06T17:52:00.412842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:00.547835Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:00.547835Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:3f3e7fe7a42ab6c88a887a201c775db51305ca98ccdc1c077c0ad329337bddcf","observation_id":"7afb59f1-6d1d-412f-a801-0c397c5fb902","resolution":{"observed_at":"2026-08-06T17:52:00.547835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:00.682210Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:00.682210Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:d62b5aa8d7baf74461f70976c26443b05f9b788862701944abe8c297aa6eccab","observation_id":"fac6ee6f-7815-4a69-b397-3b8914aa50c9","resolution":{"observed_at":"2026-08-06T17:52:00.682210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:00.809190Z","title":"P., Fonseca, E., Jansen, A., Liu, C., Moore, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:00.809190Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:c6f90627c026499bb11e23154d44c8df268b2e30fb870b15bcc9428e6e9df681","observation_id":"37e5411d-ac31-477f-b177-23cdb4519b43","resolution":{"observed_at":"2026-08-06T17:52:00.809190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.654808Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"b1c04243-14a5-4a3b-a325-5a53a88954f4","year":2020},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:00.955163Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:f8d9925ba0e6d23410a655b71c32ea3fbd703502b6320c077020de55e89930fb","observation_id":"2f2d0011-21c9-42de-8ac8-8bd128d944be","resolution":{"observed_at":"2026-08-06T17:52:03.659988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.626047Z","title":"A., Welbl, J., Clark, A., et al","venue":null,"work_id":"391ccf07-09fb-43ca-a29e-03a3f87eb180","year":2022},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.045071Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:071f766ca29561033cb5deab5c746c246de1aca5283395b470911a59311d0304","observation_id":"37702082-134f-4805-9a49-11090aa2ea46","resolution":{"observed_at":"2026-08-06T17:52:03.633753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.599780Z","title":"Y., Zhou, T., Wu, Y., Song, X., Song, X., and Zhou, D","venue":null,"work_id":"0de74312-c0bf-4724-ac80-9f1e96d06a55","year":2022},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.174452Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:b0b3404e682c5595fe3c48c92ad39b6f4065546dfe74f7db013efe9c2e93030a","observation_id":"9b6dc69b-4214-416d-b267-fcb1c66ddf4f","resolution":{"observed_at":"2026-08-06T17:52:03.608301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-16T15:28:43.775568Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-06T17:52:01.184215Z","title":"Make-an-audio 2: Temporal-enhanced text-to-audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.184215Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:90549c069ec93d472ccc78d76d9c4a55075e62fa126f1beafa5be5ac8873f682","observation_id":"00d3c353-1727-4733-8f28-74528ff1f58f","resolution":{"observed_at":"2026-08-06T17:52:01.184215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.582429Z","title":"Masked autoencoders that listen","venue":null,"work_id":"15c8a600-2952-435a-b400-097a96279be9","year":2022},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.213931Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:78f5e76e679532b14c55c1f4232d8eebab06ff064e55dad9c9307b9518a73609","observation_id":"2a5f43fe-21fe-48cd-9b11-e7a4c61f5f59","resolution":{"observed_at":"2026-08-06T17:52:03.587728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.555778Z","title":"Multi-singer: Fast multi-singer singing voice vocoder with a large-scale corpus","venue":null,"work_id":"2504b008-ae34-47cf-8833-0af2a8761c56","year":2021},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.219238Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:26824afc69a579d4f402dd9906943e330a78b4722ed33d656e76ca6a4e78edc9","observation_id":"18fbb8b4-6f0f-43a0-ba38-17ce601e8167","resolution":{"observed_at":"2026-08-06T17:52:03.564211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.533970Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models","venue":null,"work_id":"81995164-0b86-4eff-8f6e-5baa9a6aaeb1","year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.223616Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:ee75f70559a0c1c96416d3125a296ab9a10e9acea9e22e1cb763ce272d684ffe","observation_id":"6d21ca26-1789-4528-ba53-7a17a1c28ee7","resolution":{"observed_at":"2026-08-06T17:52:03.539545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.512908Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head","venue":null,"work_id":"47946b1d-2cee-49fd-b779-a309759d38c1","year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.228181Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:b31ff2a179d4bbafca6e5c3655a27bac00ec64539444e1a11a555dd5557d1a2c","observation_id":"3e716b6d-9753-4499-a314-6921d57bcdbb","resolution":{"observed_at":"2026-08-06T17:52:03.517952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.492547Z","title":"Libri-light: A benchmark for asr with limited or no supervision","venue":null,"work_id":"f3a039d4-eaa0-47cb-ae09-84d813009b7a","year":2020},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.232203Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:9f45d67bb60415f2d7db3ebe9e8a2f86aa34793249863abdeafd1d6f5024bcd6","observation_id":"6870ffb7-d2ff-4366-8664-dc5d40ae7234","resolution":{"observed_at":"2026-08-06T17:52:03.498114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T17:52:01.237816Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.237816Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:31cf75579293feebfd6770b6d1bf36de52064c1f4b843d08d35ce8ee23722630","observation_id":"e0b8c32a-d0ea-44be-80d5-bdb844a83846","resolution":{"observed_at":"2026-08-06T17:52:01.237816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.474440Z","title":null,"venue":null,"work_id":"8a8eff78-c66d-42ea-8f87-342fdcb8d6de","year":2019},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.243761Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:01558bca483d1be3fc9f2fe9af710cfd26156d6cec69da040de570d5ce2cc7fa","observation_id":"16ffc977-e3ad-4f24-b9a7-43286af54204","resolution":{"observed_at":"2026-08-06T17:52:03.480310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.248336Z","title":"Fréchet audio distance: A reference-free metric for evaluating music enhancement algorithms","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.248336Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:d08d3ac6ec7c2af8ee2f61bdfd325f6550e7a73bfa521251f824cd1fe45edd4b","observation_id":"e9f688b1-e36f-4f42-971f-d78ebffd825b","resolution":{"observed_at":"2026-08-06T17:52:01.248336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.451238Z","title":"D., Kim, B., Lee, H., and Kim, G","venue":null,"work_id":"247548e2-6f0b-4c4a-921d-2af949de7692","year":2019},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.253604Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:1b36e816b46fc2aa27a9bd478be0bc86b653abe7c46a5636a37695f74e9158c4","observation_id":"1633d887-1e67-4b46-900d-bc691d61d127","resolution":{"observed_at":"2026-08-06T17:52:03.456885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.258735Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.258735Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:d0112c8caa24f178d432fd879bedff79667388a6359bd1df039efc19f6a06db9","observation_id":"e3df56f2-9a84-4b05-a932-3aa4e49424b9","resolution":{"observed_at":"2026-08-06T17:52:01.258735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.415983Z","title":"L., and Khudanpur, S","venue":null,"work_id":"658d8f1d-ed8d-4bf7-b912-8048f4fc3c9f","year":2017},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.263424Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:2d18b9f530f8432fe7f7591ff3877b2bc2da6da73fc6aa327d74177f89f11f49","observation_id":"8a536864-c439-427a-8f8f-8aa1e41aee2f","resolution":{"observed_at":"2026-08-06T17:52:03.421191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.397153Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"754b423d-badf-444a-adfe-fc10ae51fd2a","year":2020},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.267953Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:82ad63c425ce308e32fb381596a47a79269f1bbfd5f5afdf8ea4e95585ba4f8b","observation_id":"c70c4e96-2868-49f3-a1d6-3eacbbe8deab","resolution":{"observed_at":"2026-08-06T17:52:03.402332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-16T14:22:01.900523Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-06T17:52:01.273007Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.273007Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:e25572f5898d96b3ab10e7a0d027b25f94d4e000ed17d337326091b0e18b2340","observation_id":"440641c6-c83a-4f55-8136-78748904b95a","resolution":{"observed_at":"2026-08-06T17:52:01.273007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.377585Z","title":"Improving text-to-audio models with synthetic captions","venue":null,"work_id":"e97bdd2e-a13a-4aae-b5e6-cb232d7adc96","year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.279126Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:e7d5348065d9ddf5e7cc9b8f1fe5138d81b95e4b4a2b9b75d1cca8304278d62c","observation_id":"fa454552-bffb-48ad-93c2-2f40b5e84d5f","resolution":{"observed_at":"2026-08-06T17:52:03.383749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.354320Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":"7edf8e38-79cd-4648-a417-c0b2f0ebed57","year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.284072Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:3524b4d2f1feba400eb6045e426043aa58176707561e855dc909b8de5db9e280","observation_id":"a9a46066-f5de-4bcc-85f8-29c5f0fd42f4","resolution":{"observed_at":"2026-08-06T17:52:03.360536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.333930Z","title":"H., Gonzalez, J., Zhang, H., and Stoica, I","venue":null,"work_id":"e3b5c574-6711-4b3e-a97a-2d883f5da90d","year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.288125Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:3f278e38454859e7901f155871445e1e33e69a77d31d9386f293618376628bde","observation_id":"eea8ee73-f8c5-4e9f-b3ad-8eb3833668e2","resolution":{"observed_at":"2026-08-06T17:52:03.341394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.292238Z","title":"BART : Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.292238Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:8350909e29fb89a19c7768e5a2cd3a59108ebb8282558798ec2de3c11b105da3","observation_id":"1eaaa474-480e-48ba-8ada-a5c5e5c5a144","resolution":{"observed_at":"2026-08-06T17:52:01.292238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.316681Z","title":"Mage: Masked generative encoder to unify representation learning and image synthesis","venue":null,"work_id":"807dddf3-f0c9-434a-9ab9-0570f98d1bd6","year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.296437Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:2cd1eb369250c1f85c712cf3d55a94e4607026c9e7262b8425a4400b5fd35918","observation_id":"926336f8-631a-495c-819f-45acf7f2b8d7","resolution":{"observed_at":"2026-08-06T17:52:03.321304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.300509Z","title":"Return of unconditional generation: A self-supervised representation generation method","venue":null,"work_id":"719fc8fa-5c24-4e94-81d9-dc1a8af39f5a","year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.301026Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:b590a0da789b5cf634c43d43d129f1a5db0edee2c33df88ecc0752c80a6eb617","observation_id":"d4d2f52c-928c-4dd5-bf97-47024de5e9dd","resolution":{"observed_at":"2026-08-06T17:52:03.305695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-16T13:42:07.461220Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-06T17:52:01.305060Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.305060Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:a84f142696c47a206092814879344758769197e02d5cc5800fadd6d0283f047a","observation_id":"7457cd7f-a098-4381-8288-37a4f9e18515","resolution":{"observed_at":"2026-08-06T17:52:01.305060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.282418Z","title":"T., Ben-Hamu, H., Nickel, M., and Le, M","venue":null,"work_id":"6e905deb-be77-4d17-98e0-1936a6ab5586","year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.309511Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:cadfec3a7ff72d7dd88dec3702c0159173c562d52a0cd400db61a0a415f670dd","observation_id":"72d09736-9ec7-42e4-8df1-5abb5454db58","resolution":{"observed_at":"2026-08-06T17:52:03.287718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.265648Z","title":"H., Le, M., Vyas, A., Shi, B., Tjandra, A., and Hsu, W.-N","venue":null,"work_id":"ff6ced8e-5ccd-4091-afd5-92d365fe7b03","year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.313858Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:fd5f1bd205b99f6ebe1ab74bffb403672646b15f2552177e2fe8ce01f205c2de","observation_id":"c0b54332-2903-44e3-91be-6326942d9fcb","resolution":{"observed_at":"2026-08-06T17:52:03.271019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.249335Z","title":null,"venue":null,"work_id":"274cb728-227a-4047-98bd-4ef52a063b94","year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.319281Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:112824b438ff39c2078a9afd5553ab030c9b2fb2e2c321e04e1d8642814c128e","observation_id":"9160d2de-b07d-428b-9075-cdfdd6652322","resolution":{"observed_at":"2026-08-06T17:52:03.254397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.229599Z","title":null,"venue":null,"work_id":"5db60209-6bac-4d3a-8ebe-b3081979d0a1","year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.323474Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:8029577851d0f28952eb95d2594ffbe41db9161426183b37856b4be8d77cdfef","observation_id":"58d091aa-b5d3-4e9f-856f-44b9ee5d9390","resolution":{"observed_at":"2026-08-06T17:52:03.235176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.328026Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.328026Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:3748a7ee555e832c36219e67e49f777beb03341ce6dd0505dbc87e3349483cb0","observation_id":"976a0627-d358-4905-9b8e-a3b0aeaad50c","resolution":{"observed_at":"2026-08-06T17:52:01.328026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14335","last_updated":"2023-11-26T14:12:37Z","snapshot_observed_at":"2026-08-16T15:13:02.805936Z","submitted_at":"2023-07-26T17:54:04Z","title":"WavJourney: Compositional Audio Creation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14335","snapshot_observed_at":"2026-08-06T17:52:01.332297Z","title":"D., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.332297Z"},"links":{"cited_paper":"/paper/2307.14335","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:afa942a340e7e6402f6467ffee6f1c0ef1c449d822c7f5f728d2f6a220963f40","observation_id":"6bc4c674-906f-4cbc-9c29-da63ae7d750b","resolution":{"observed_at":"2026-08-06T17:52:01.332297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.212449Z","title":"and Hutter, F","venue":null,"work_id":"5c671f33-00a3-477b-8d0e-92dcfc2a431d","year":2017},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.336968Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:555c7afc1fe0e2710e864fff896b68c8446d57d0cd3d851ce59653ee9fdcb154","observation_id":"a19659c4-ad7d-4e37-8527-c677e4344439","resolution":{"observed_at":"2026-08-06T17:52:03.218694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09956","last_updated":"2024-07-17T16:17:50Z","snapshot_observed_at":"2026-08-16T14:00:45.074987Z","submitted_at":"2024-04-15T17:31:22Z","title":"Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09956","snapshot_observed_at":"2026-08-06T17:52:01.341231Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.341231Z"},"links":{"cited_paper":"/paper/2404.09956","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:3616450148f5087b1071f9b880149381a3bc4653788d0fdd0cbf12e1007b803c","observation_id":"abc45090-463f-488d-aa53-1b2bcc510a71","resolution":{"observed_at":"2026-08-06T17:52:01.341231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.188542Z","title":"and Mesaros, A","venue":null,"work_id":"4795c991-c544-424c-8680-68b1dd13f746","year":2021},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.345701Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:396208b1a3bb24c2e7a38fd217d34caec587dad898c09ce4b7ad48303a1da91b","observation_id":"f4355582-dd0a-41b2-b185-378f2ad61988","resolution":{"observed_at":"2026-08-06T17:52:03.198657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.153031Z","title":"D., Zou, Y., and Wang, W","venue":null,"work_id":"8eb0f676-5217-41d9-9e55-0896680b0811","year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.350124Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:5d92cb6540086665e1afd5d7e330b89f3a49938abbda0516d81d7b64a9824dc5","observation_id":"45847a8c-fc0d-444c-89b1-72b49a3675b1","resolution":{"observed_at":"2026-08-06T17:52:03.159641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-17T17:09:21.212561Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-06T17:52:01.354517Z","title":"Autoregressive speech synthesis without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.354517Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:a07945655c48d5244d8dd2bf6a9e06e2d779209e6903760787f7b6257516f835","observation_id":"a6d23f78-8a35-4503-ad35-76443289acc7","resolution":{"observed_at":"2026-08-06T17:52:01.354517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.129505Z","title":"Tut database for acoustic scene classification and sound event detection","venue":null,"work_id":"f9e797a9-e538-448c-a0e8-31d10dcc3b23","year":2016},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.358779Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:c320a48ccbbf5fa411e99fdc7f2895aaacfa90a68148ed86ea5c42d2b3803b4e","observation_id":"f8492c75-26f3-4dd3-bdfc-8bf8d6648e31","resolution":{"observed_at":"2026-08-06T17:52:03.136505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.111110Z","title":null,"venue":null,"work_id":"5e438e18-6dcf-4d37-ab82-0b51d76f2b0c","year":2021},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.364310Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:bdfb267f58c6a2cb4d5ebd649fdece7e5153a5dbd39597285f734b6513b05171","observation_id":"865789cd-22c9-45fb-b376-28e073686cea","resolution":{"observed_at":"2026-08-06T17:52:03.115867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T17:52:01.368588Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.368588Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:c3d0af8dedf881bbb4dc2a7b8f615804a62c651487fb2c886f0374f71bc01abd","observation_id":"427962f7-691a-4c83-bedd-0c2aed94f56c","resolution":{"observed_at":"2026-08-06T17:52:01.368588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.373095Z","title":"V oice C raft: Zero-shot speech editing and text-to-speech in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.373095Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:c85ea7ff049b3719152bb85bdf70fd584ae842460ce0f625b4e5f2b90c834612","observation_id":"3f5e2073-32bc-40e7-be03-b460cf02c153","resolution":{"observed_at":"2026-08-06T17:52:01.373095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.090738Z","title":null,"venue":null,"work_id":"662e430b-11bd-420d-8694-9fa10e6bbb30","year":2015},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.377763Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:b4aea6c26a999f45b1ec9a6b55f84c20142422eb565e7c84d1e581d69edb8778","observation_id":"187129eb-926d-4f26-8181-f2bebba7da45","resolution":{"observed_at":"2026-08-06T17:52:03.095751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.071734Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":"6eac0cef-8c20-49f3-98f5-aa230651c0ce","year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.382718Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:d7698419e3b280f876328fa7735f7c24a0c57f7563f9e45cf53789bfc2761a59","observation_id":"0db66797-635f-400b-86c0-23f335df4d04","resolution":{"observed_at":"2026-08-06T17:52:03.077930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.387418Z","title":"Mls: A large-scale multilingual dataset for speech research","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.387418Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:bd528a669c264c9e021b62fde39d8d4be9516e4783726b444410287de42885df","observation_id":"746df0df-790b-4155-a39d-5621ff9ff935","resolution":{"observed_at":"2026-08-06T17:52:01.387418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.392376Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.392376Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:0622610b67d4da757a7774b6ce74ca98f96a5b0ca7b617888bc5f70a069afd7c","observation_id":"66bfd605-536e-40f4-ae3d-798f1a1479cf","resolution":{"observed_at":"2026-08-06T17:52:01.392376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.396597Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.396597Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:6d9ce55fe6d1c2afb77e7c6885561d97f815514d83dcbc72c58e5cc5a22f4359","observation_id":"af7feb3f-8431-4637-8538-9647bda313ee","resolution":{"observed_at":"2026-08-06T17:52:01.396597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:03.001603Z","title":null,"venue":null,"work_id":"8273b261-46ed-4f2b-b607-984bddd9a3b5","year":2014},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.401383Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:a75ce504a98af1a7e4693b843f1260637cf77a05c3ce3b58f5c0efbdad3e6847","observation_id":"ed94b629-7d2c-4802-9320-835418568bf0","resolution":{"observed_at":"2026-08-06T17:52:03.009050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:02.973199Z","title":"Edinburgh neural machine translation systems for wmt 16","venue":null,"work_id":"77409b25-35c1-441a-aac9-34cab99db1c7","year":2016},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.408251Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:0c77c0ef1f3590a9454c49cf7f13a5feb9d7d4fc4b576ce28e36b4efecefa4ad","observation_id":"28dcd45f-6e60-4104-8e9c-e2b3164ada7d","resolution":{"observed_at":"2026-08-06T17:52:02.980768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.413702Z","title":"Aishell-3: A multi-speaker mandarin tts corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.413702Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:2d225f8d8c0b45bbbe068ff0ee9d890bbede064a43b03ec447b1aed08fb25d9c","observation_id":"ef3d9cbd-4885-42fc-a0b4-6f03e0528f8e","resolution":{"observed_at":"2026-08-06T17:52:01.413702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08635","last_updated":"2024-12-11T18:57:32Z","snapshot_observed_at":"2026-08-16T13:00:15.419884Z","submitted_at":"2024-12-11T18:57:32Z","title":"Multimodal Latent Language Modeling with Next-Token Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08635","snapshot_observed_at":"2026-08-06T17:52:01.425532Z","title":"Multimodal latent language modeling with next-token diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.425532Z"},"links":{"cited_paper":"/paper/2412.08635","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:cac3fa896f9cf219fcdd277bf4a6d8dafd23ec22a4c810b529b825b86e1f9a57","observation_id":"bfca80dc-66b3-417d-9d16-3d699de38484","resolution":{"observed_at":"2026-08-06T17:52:01.425532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T17:52:01.430636Z","title":"M., Hauth, A., Millican, K., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.430636Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:681d06dee5a1bc7d753148ed58fc914e8407bc703b1936170c499cdc2447625a","observation_id":"2459c5e0-90cd-46b5-bdca-fca0c4b2e0b9","resolution":{"observed_at":"2026-08-06T17:52:01.430636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:02.943286Z","title":"Givt: Generative infinite-vocabulary transformers","venue":null,"work_id":"6a5f811e-f56a-4a4e-8122-542bc89ecbde","year":2025},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.436170Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:4324b32f3277aa580eb9acdf9dc5b63e56ac63d100fa511446e1a2650e333989","observation_id":"9893182e-d96d-438f-ab12-5bdfbe55e876","resolution":{"observed_at":"2026-08-06T17:52:02.950079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.440950Z","title":"and Cook, P","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.440950Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:9c042dd80bfc365527ea6d2f4e6e4b0206ff194c8c5edb0939f1fb39fa22b0c2","observation_id":"b68b9619-f751-435b-bc8c-25b8e8517066","resolution":{"observed_at":"2026-08-06T17:52:01.440950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.445811Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.445811Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:7aec2b986d560a281c0e5595845658635ee70ddf5442944f7c84a49eb39ab0c6","observation_id":"ef59f598-6cef-4a2d-82d4-5e906935bc04","resolution":{"observed_at":"2026-08-06T17:52:01.445811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-06T17:52:01.451574Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.451574Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:e82ad96cd6b506eabbbbee1d1cb4738272490c4116a0ef5418ffc716358af059","observation_id":"cca6c30e-5db6-455d-9495-cd915c13d794","resolution":{"observed_at":"2026-08-06T17:52:01.451574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.457448Z","title":"GLUE : A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.457448Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:2c1767b2de3d2110f13bc43921e202be6d515593bb394aed812e0eb67a117574","observation_id":"5f6e0d75-48dd-4771-8145-0a7b0a03094a","resolution":{"observed_at":"2026-08-06T17:52:01.457448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-16T13:03:42.737566Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-06T17:52:01.469864Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.469864Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:a126a7339d7efbb05d56ada9844cd03b37a2a7ee54f414d99e2929aae2038d1e","observation_id":"d0e3b8bf-90c4-49c6-8219-cfe9ef22e744","resolution":{"observed_at":"2026-08-06T17:52:01.469864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:02.876736Z","title":"Not all images are worth 16x16 words: Dynamic transformers for efficient image recognition","venue":null,"work_id":"2d51f12f-9278-4cd8-9cb0-fe3c5128f643","year":2021},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.479739Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:8e4779849dd9bbec02789e17c63dc3ba76cad66eb275161b52d8145e1697722a","observation_id":"274d4217-a588-4314-b5fe-40f706ad600b","resolution":{"observed_at":"2026-08-06T17:52:02.882459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.485978Z","title":"Opencpop: A high-quality open source chinese popular song corpus for singing voice synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.485978Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:1ea8bd123794bfe80cbce87d578f509183c427f64afeb3d806d6eda11be1635b","observation_id":"1455e529-5dc8-4ee6-9905-c9cc1011c562","resolution":{"observed_at":"2026-08-06T17:52:01.485978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03335","last_updated":"2025-01-14T11:59:03Z","snapshot_observed_at":"2026-08-19T22:37:37.824771Z","submitted_at":"2024-10-04T11:40:53Z","title":"Audio-Agent: Leveraging LLMs For Audio Generation, Editing and Composition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03335","snapshot_observed_at":"2026-08-06T17:52:01.491237Z","title":"Audio-agent: Leveraging llms for audio generation, editing and composition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.491237Z"},"links":{"cited_paper":"/paper/2410.03335","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:281be56d5eafa6d03508df3b3ef0c0c9e1cbe08386d32870e4f63fa3e6030434","observation_id":"73930923-0f38-4e9a-b494-22d38efcd2c9","resolution":{"observed_at":"2026-08-06T17:52:01.491237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:02.847691Z","title":"Diffusion models as masked autoencoders","venue":null,"work_id":"2e079500-e72a-447e-b979-8dc1622ffb83","year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.497486Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:aa26f213d0f9a3ccd3b62102a0118da4c5de65553e484a9c0414a238235d824e","observation_id":"16268694-8cab-4e2e-bd06-db066041aaa6","resolution":{"observed_at":"2026-08-06T17:52:02.856725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:02.826645Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":"9be70da8-39ce-4724-80a1-ae1d60fb945e","year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.508042Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:fcfbc220ab362dd2eb9c45dd215cea806c8f51c2e458a797794e8c336ae21d94","observation_id":"a2daa00a-9398-4e6a-8389-73a9985e13d2","resolution":{"observed_at":"2026-08-06T17:52:02.832100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:02.802862Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"54897372-1fda-4b4b-9b44-d1223165407b","year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.515390Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:c6a60db40cba3d2b76ce2f5dfe9ce4ad888374c06f3906e722c837df924105e8","observation_id":"25a4ed29-91fa-4a41-8828-972a4d28a8e7","resolution":{"observed_at":"2026-08-06T17:52:02.811159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-16T14:56:06.586855Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T17:52:01.524187Z","title":"Uniaudio: An audio foundation model toward universal audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.524187Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:bf6db99636ece0e97b7a33da82e3c56d06e18be60f7dba012a5cb35c592c1fcb","observation_id":"d682d2a4-1638-47e1-b3b7-c04993354b10","resolution":{"observed_at":"2026-08-06T17:52:01.524187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:02.781320Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation","venue":null,"work_id":"91c4a0ce-8378-4c25-9c78-4f37384a65c9","year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.531566Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:c53f3e024e706dbecb356b0f5526594a61d47ba194440545204247850383f1f9","observation_id":"2bd5f09c-b538-41e3-913e-6fd813e5c2e3","resolution":{"observed_at":"2026-08-06T17:52:02.787593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-06T17:52:01.536164Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.536164Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:ba81ea696b0678730cbeadd14388c03eab42f793dbfc396f53c0c694da013930","observation_id":"d8eedf5d-1025-4ae7-8e73-2b187c2b7dff","resolution":{"observed_at":"2026-08-06T17:52:01.536164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:02.760224Z","title":"Megabyte: Predicting million-byte sequences with multiscale transformers","venue":null,"work_id":"28e4850a-c247-42db-8b02-b0d740e81240","year":2023},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.540872Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:af2b30a6d23f19d519ebe588f252b4f893a0d53daba66763799f8194d93bc8ed","observation_id":"1469058c-b513-4177-8fde-bf5021854bdb","resolution":{"observed_at":"2026-08-06T17:52:02.766346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:02.737482Z","title":"and Robnik- S ikonja, M","venue":null,"work_id":"4ed453d1-9fa8-4f13-a876-e3bc4e3ac752","year":2022},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.545972Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:8ed982c20377a294edad5ab41758f53a7d8a71bdb20ed9ed823a6fba145328da","observation_id":"eb91844b-c631-4bae-bcbb-c0c20c1d8031","resolution":{"observed_at":"2026-08-06T17:52:02.743229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.2329","last_updated":"2015-02-19T14:46:00Z","snapshot_observed_at":"2026-08-21T00:41:57.850170Z","submitted_at":"2014-09-08T13:08:00Z","title":"Recurrent Neural Network Regularization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.2329","snapshot_observed_at":"2026-08-06T17:52:01.550702Z","title":"Recurrent neural network regularization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.550702Z"},"links":{"cited_paper":"/paper/1409.2329","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:56ac576260989ad79871f14e4ee2d9735e84854c87d3a9301377debb58ead745","observation_id":"fb7ecedb-7c9f-4d9c-9e05-0d3081796c59","resolution":{"observed_at":"2026-08-06T17:52:01.550702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:52:01.555758Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.555758Z"},"links":{"citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:662d3b1d768c694713b6094493e3bfad57c3e2974aad36409e93d659cfede113","observation_id":"bd6314dc-4f79-4ffa-bada-bcdecbd88de3","resolution":{"observed_at":"2026-08-06T17:52:01.555758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-15T03:32:36.161797Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":67,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":105},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 0 inbound Pith citation observations for arXiv:2507.09834."}