{"as_of":"2026-08-09T22:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0942213b4e8b7f94a3d927c278f62b5a930115ab519b2b6982576f3e30f305e","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:41:42.630260Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:15:19.738180Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02398","snapshot_observed_at":"2026-08-03T14:15:19.738180Z","title":"Audio Realism Bottleneck","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21094","last_updated":"2026-06-02T17:15:46Z","snapshot_observed_at":"2026-08-06T21:10:12.336800Z","submitted_at":"2025-12-24T10:30:35Z","title":"T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T14:15:19.738180Z"},"links":{"cited_paper":"/paper/2509.02398","citing_paper":"/paper/2512.21094"},"observation_digest":"sha256:63dc428aa2e1f2df9c3822b9e92fd0de48b6cc8b5ae9022b64471edad4b7dbb0","observation_id":"78f06cc1-9ee8-448f-9d55-fd981c687bef","resolution":{"observed_at":"2026-08-03T14:15:19.738180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.02398/citation-record","integrity":"/paper/2509.02398/integrity","json":"/paper/2509.02398/citation-record.json","paper":"/paper/2509.02398"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:36.903557Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:36.903557Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:fac348d8bc5c1d7cb74000fd8ff61fd2b7f8d80bf04a90b7f1adbec640c47de8","observation_id":"d5dcd889-720a-45da-8f49-d835ab69ff34","resolution":{"observed_at":"2026-08-05T11:41:36.903557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:36.976869Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:36.976869Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:49a2ae247bfc02b8bd65e24ac1edd09423d7623379a76ac87e77e42a8f2cbe89","observation_id":"dc5b1df7-2576-4546-af32-b967b8235916","resolution":{"observed_at":"2026-08-05T11:41:36.976869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T11:41:37.045025Z","title":"L.; Almeida, D.; Altenschmidt, J.; Altman, S.; Anadkat, S.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.045025Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:1fb84afa0e61a8132b5dfa93bced906d5ee69e276aade356406f7a8748763384","observation_id":"b087600a-e585-4099-a12b-e0f2f8840f2f","resolution":{"observed_at":"2026-08-05T11:41:37.045025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.600708Z","title":"M.; Sun, P.; Shen, X.; Khan, F","venue":null,"work_id":"057d79ce-7dab-453b-bb04-5f6e0b17ddd7","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.106208Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:dbd1c64d0157bbd77294387edd76e8c7e8f8ff119707c1409f2596ecea40037b","observation_id":"3d65202b-f935-4d35-bae0-a9c0b00c2aa0","resolution":{"observed_at":"2026-08-05T11:41:43.605202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01973","last_updated":"2018-06-21T14:54:33Z","snapshot_observed_at":"2026-08-07T19:33:19.839652Z","submitted_at":"2018-01-06T05:44:29Z","title":"A Note on the Inception Score","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01973","snapshot_observed_at":"2026-08-05T11:41:37.186988Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.186988Z"},"links":{"cited_paper":"/paper/1801.01973","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:461efea0f7e63c7f8b88839235f75cb569342dc0a2d74d225e9141848499ebcc","observation_id":"e14e216c-35ab-42a4-ac73-1579598531ca","resolution":{"observed_at":"2026-08-05T11:41:37.186988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.585853Z","title":null,"venue":null,"work_id":"430082d1-16b7-4ca4-a39d-8b997dce2436","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.252463Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:931eb1c7df2b680ee1dd763e31c7e12014ab1eee7372d3088e264a99f4e6c9c7","observation_id":"a53c0bf7-96e9-4849-934b-a71b8408b3ea","resolution":{"observed_at":"2026-08-05T11:41:43.590096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.570016Z","title":"W.; Hou, L.; Longpre, S.; Zoph, B.; Tay, Y.; Fedus, W.; Li, Y.; Wang, X.; Dehghani, M.; Brahma, S.; et al","venue":null,"work_id":"abbc559c-1a73-46d3-bd3f-6494b52ecb46","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.307296Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:9c3882701e12c1b0e2ca2ee79668bb6dda4a2ffdb0516508f8522bbd6354aef8","observation_id":"d3dfabe1-0107-4e44-9df5-2d3234d90140","resolution":{"observed_at":"2026-08-05T11:41:43.574812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.555060Z","title":null,"venue":null,"work_id":"a7a4d5c8-68b3-45aa-9c7c-9ec727855c71","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.371650Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:d70cc52c00597a5844cb23ca5de44af230224d59ca21ab90a6b3d149a90e6a65","observation_id":"937c0d92-84b3-4b0f-842c-91f695639b2f","resolution":{"observed_at":"2026-08-05T11:41:43.560038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.540244Z","title":null,"venue":null,"work_id":"3466874a-a885-44fd-85d8-f617dd93e045","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.447626Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:790288e57e543d66352a117e50e312f8106b411d3f02aea9854de34eb45ed566","observation_id":"8ddc3776-f88f-46da-b2da-0489a567bb41","resolution":{"observed_at":"2026-08-05T11:41:43.544677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.524889Z","title":"D.; Gangal, V.; Gehrmann, S.; Gupta, A.; Li, Z.; Mahamood, S.; Mahendiran, A.; Mille, S.; Srivastava, A.; Tan, S.; Wu, T.; Sohl-Dickstein, J.; Choi, J","venue":null,"work_id":"a53a701e-fd8c-445f-ab80-c54469399023","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.515414Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:88275e451a2a77e707b8b01112e9293dd3939f2ad7262ab92d995c46fa9d7063","observation_id":"a58a4a34-7ce8-4918-b38a-4a478ac7b27e","resolution":{"observed_at":"2026-08-05T11:41:43.529390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.510537Z","title":null,"venue":null,"work_id":"58ec8442-e62b-4e3e-b76c-0d032752ae67","year":2020},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.583856Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:5fc755aaa6c12288e53e1a740a997c9844ff79f1f64f1353dedde2a0d5fd50f1","observation_id":"7dd7345a-5119-4ac4-aaf5-858887960335","resolution":{"observed_at":"2026-08-05T11:41:43.515163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-09T10:28:41.771465Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-05T11:41:37.651853Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.651853Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:abb0561e323d2a87efdab35753d871693d26563840de352b875aa7f4d943df8d","observation_id":"f6cfd9a2-ca3e-476d-a1b4-21d2210b9d49","resolution":{"observed_at":"2026-08-05T11:41:37.651853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.495351Z","title":null,"venue":null,"work_id":"c4a586f4-21da-4099-bc39-6be6f1b209da","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.720522Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:a5054e21d81021b7441290dea782f1ecea988548386c9fb0a6de999b21a6141f","observation_id":"e06e9f39-3049-41e3-89eb-b7d6dd567c2c","resolution":{"observed_at":"2026-08-05T11:41:43.500134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.481159Z","title":"H.; and Pons, J","venue":null,"work_id":"3d2ae748-915f-46b3-b842-70335ef69159","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.823392Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:0a5792835ce191163f8480b8af3283a89602fa9be92bf1b546811765edce857f","observation_id":"517f7538-002e-48f8-915f-20c64e00ecdf","resolution":{"observed_at":"2026-08-05T11:41:43.485453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-07-06T15:20:25.388057Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-05T11:41:37.929378Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:37.929378Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:5fb76aa4c37aebd1df76797f2bb1f87f0b57ab0faf33866cee2d8c3d5466cc43","observation_id":"c73a878b-9120-4d7c-b9d8-0d069b9b32f4","resolution":{"observed_at":"2026-08-05T11:41:37.929378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.465640Z","title":null,"venue":null,"work_id":"f0d278ea-0fa0-4a44-ba30-596fd26693a2","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.046523Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:b7cc2681dad395aa82448077ca517ea64418c0d64afb8035ee658271cce5b7da","observation_id":"4a716745-4ef0-4b1d-a7fc-5a5e4476fd88","resolution":{"observed_at":"2026-08-05T11:41:43.470062Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15922","last_updated":"2026-04-08T21:03:14Z","snapshot_observed_at":"2026-07-06T20:10:56.727212Z","submitted_at":"2024-12-20T14:14:00Z","title":"RiTTA: Modeling Event Relations in Text-to-Audio Generation","version":4},"cited_work":{"arxiv_id":"2412.15922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.15922","snapshot_observed_at":"2026-08-05T11:41:43.000825Z","title":"RiTTA: Modeling Event Relations in Text-to-Audio Generation","venue":"cs.LG","work_id":"04d527af-caef-4cb9-af53-22356c11de86","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.120541Z"},"links":{"cited_paper":"/paper/2412.15922","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:6db6f8c3387b5d042687e6d92affe32c7a06c19762ef85aab7d8e5606b6ca2db","observation_id":"94347dab-e043-4b53-a086-ac885ed445df","resolution":{"observed_at":"2026-08-05T11:41:43.005859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-08T06:05:53.280034Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-05T11:41:38.158041Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.158041Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:9abcd4a5a081354964898b4ef8b26635dcffc39ab1f3f5fd01425342184f7890","observation_id":"aaf4e0b3-ce77-4503-ba96-a8f700c39137","resolution":{"observed_at":"2026-08-05T11:41:38.158041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.449515Z","title":null,"venue":null,"work_id":"1eeaf2a3-4c53-4188-8b18-701cc1599b1b","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.276559Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:cce708f9b7b4ac839388d30deee6d5f568e1ffa7da7bef25f78ea7d78ebe0d0e","observation_id":"c1f24d91-c294-47b4-bff1-1cac58835ffe","resolution":{"observed_at":"2026-08-05T11:41:43.454703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12661","last_updated":"2023-01-30T04:44:34Z","snapshot_observed_at":"2026-07-06T14:45:55.345502Z","submitted_at":"2023-01-30T04:44:34Z","title":"Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12661","snapshot_observed_at":"2026-08-05T11:41:38.414553Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.414553Z"},"links":{"cited_paper":"/paper/2301.12661","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:63cbfc34ed9090a92de41b5e2325257db8dc1a732373071eecafea7a5386d116","observation_id":"20f76eff-91e0-4932-9428-ddb08a723f8b","resolution":{"observed_at":"2026-08-05T11:41:38.414553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-05T11:41:38.641129Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.641129Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:f700b82e7e828f4b5b2ad098abce3bc338a08332c6a19486110489c8333a0364","observation_id":"13c50be9-da31-43b0-98bd-34f50c9807a1","resolution":{"observed_at":"2026-08-05T11:41:38.641129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.433845Z","title":"D.; Kim, B.; Lee, H.; and Kim, G","venue":null,"work_id":"7babe598-f0f3-4b5c-9499-8d2cdc3f2a6c","year":2019},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.838863Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:941d1aba55cb05b3b4734c499ae358a4583373392c9a842d9c57cf5fc3bd8286","observation_id":"140e9e66-06fc-47b4-a19a-803af9a88787","resolution":{"observed_at":"2026-08-05T11:41:43.438869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.416687Z","title":"D.; Kim, B.; Lee, H.; and Kim, G","venue":null,"work_id":"222b7778-1f9f-4092-8e2d-e01d4a9c4f0c","year":2019},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:38.975778Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:87d896c53485f0c0a18930733993abe16090369140746f9db02ad74f299742d0","observation_id":"9df640ce-c8b2-458f-9563-aaa69466c5a7","resolution":{"observed_at":"2026-08-05T11:41:43.421994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.401291Z","title":null,"venue":null,"work_id":"02c3920e-ced9-489a-868b-553240311077","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:39.124727Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:7a62b5d6d483b84c21b6be15d523f979b9afca8a8d3d11053c85fb9f70f5abab","observation_id":"e6e2f966-2ed4-4bb1-be30-68fcba4b1134","resolution":{"observed_at":"2026-08-05T11:41:43.405749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.386089Z","title":null,"venue":null,"work_id":"5d52afe1-9b73-4749-8b23-834438ebcf58","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:39.321695Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:13dc1760145594b2fe7c4cf8e20b102384386bf293d20893db7d5eb919ba175d","observation_id":"784efbf6-f6f0-4cce-ac17-483e7189f1af","resolution":{"observed_at":"2026-08-05T11:41:43.390545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04287","last_updated":"2023-11-07T19:00:56Z","snapshot_observed_at":"2026-07-06T16:44:27.404644Z","submitted_at":"2023-11-07T19:00:56Z","title":"Holistic Evaluation of Text-To-Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04287","snapshot_observed_at":"2026-08-05T11:41:39.459567Z","title":"S.; Gupta, A.; Zhang, Y.; Narayanan, D.; Teufel, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:39.459567Z"},"links":{"cited_paper":"/paper/2311.04287","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:d6629e60cf789e38c3ec1e50e97f03bae9adea11e10e0f39c078d1660b03f0e6","observation_id":"6b9ed27e-c7f5-414e-89be-544c7130de33","resolution":{"observed_at":"2026-08-05T11:41:39.459567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.371075Z","title":null,"venue":null,"work_id":"bb4db66d-4c7b-4f57-af88-207c9e6f485a","year":2019},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:39.622361Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:1d33e6980a4dfe90662b7775ef3b52e7c2fd0551618b1c87ec4dad3765cefd3e","observation_id":"ce95158d-1536-4a9b-8d2c-291dd08431e4","resolution":{"observed_at":"2026-08-05T11:41:43.375845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.356354Z","title":null,"venue":null,"work_id":"83625a81-4f6c-4ee4-b712-623eb01d278c","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:39.778413Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:b1912dd0e6d6e949a29a6c94da912431f86676c88c10bf56586ae64d78bf2ffa","observation_id":"a6cdb93e-131c-40a9-8fd1-2dd359e08ad6","resolution":{"observed_at":"2026-08-05T11:41:43.360815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.341145Z","title":null,"venue":null,"work_id":"e1f185ec-507d-431b-bd8d-49115bb27d07","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:39.938378Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:a424a4c1a22bd59a245b9d6730984e5ad32376ae4a21f76ca18312c7be2793d7","observation_id":"b656a29c-6f60-48eb-ae44-9515c87154bd","resolution":{"observed_at":"2026-08-05T11:41:43.345449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.326267Z","title":null,"venue":null,"work_id":"933875c6-d6db-4deb-9200-56d6ecb23c77","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:40.116121Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:0efbb680ecbd9f0edcb83967475229e48cb17332a04274ec59d6250cf810f699","observation_id":"c150b44b-e46f-4221-8df9-c1845d1267d7","resolution":{"observed_at":"2026-08-05T11:41:43.330941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.310879Z","title":null,"venue":null,"work_id":"5687f63e-80df-4b0e-845b-1822d3251426","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:40.315668Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:c85e5e7ede6528113a57aacba7ce41aa126b41c87e4071d47e6ccdadb39f0f76","observation_id":"1ac895c6-5fdc-4058-a200-3301cdd7472f","resolution":{"observed_at":"2026-08-05T11:41:43.315959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11802","last_updated":"2024-09-21T06:53:58Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:49:01Z","title":"PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11802","snapshot_observed_at":"2026-08-05T11:41:40.468843Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:40.468843Z"},"links":{"cited_paper":"/paper/2406.11802","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:0ff80096cb9c918b82ac08bda14f2944a9c670859e22fc2d7deae8ceb96de5f4","observation_id":"0089645e-d458-4b19-86f0-c210bd041eae","resolution":{"observed_at":"2026-08-05T11:41:40.468843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.295169Z","title":null,"venue":null,"work_id":"e7dddffd-737f-4fdc-847a-3a674c8c88b8","year":null},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:40.654768Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:dc9f4a920394e85a5d5b5086009df8fd0c3baf821a49b9b159f9d4174c42f4ec","observation_id":"6935ba13-45df-4fc8-a068-82646b3520b0","resolution":{"observed_at":"2026-08-05T11:41:43.299743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.280170Z","title":null,"venue":null,"work_id":"326403e5-6551-4f61-916b-8a3b569073cb","year":2021},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:40.840100Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:c9baa3835f384ce95c5b9b046c60f47427330b59e7093c799c21a9352bccfaf0","observation_id":"5d563cf9-ffe0-42fd-89c4-8540f68ddaad","resolution":{"observed_at":"2026-08-05T11:41:43.284385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.265464Z","title":null,"venue":null,"work_id":"6d306781-a0c1-49a9-bd6b-4a6134e28613","year":2022},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.001924Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:d96b0fd53062ec89f985977575ef3d9c11b1cbcd96a6df9924517b64f6746630","observation_id":"d5fd21ee-cc51-4183-bda7-048c74c7c5cd","resolution":{"observed_at":"2026-08-05T11:41:43.269921Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.250137Z","title":null,"venue":null,"work_id":"c0c38f50-dce6-40b8-8604-f0312f1c70c7","year":2022},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.173082Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:acc75767abe452e3d524bb6d3534fb78ceebb3cb7ab703404f0886652fd6bcb0","observation_id":"ab88f6ed-8e33-4d64-84c0-dcf87ca9b1d2","resolution":{"observed_at":"2026-08-05T11:41:43.254946Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.235731Z","title":null,"venue":null,"work_id":"1e4295c6-599e-47d4-bbce-9c21f6472498","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.336409Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:6776b8725d3864147e695869504dd455937056941ab503804fdd31fc6397fde6","observation_id":"4e881a39-3b77-4e08-bbfd-d116cabf125f","resolution":{"observed_at":"2026-08-05T11:41:43.240097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.220432Z","title":null,"venue":null,"work_id":"c2eacef2-a684-4925-89ed-eae001ebb94f","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.416723Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:c31d2f3605fa464aa72401efd4d705d31583a8b070f439c4e36abf55141dc037","observation_id":"8a20bc0f-b9ae-4d1c-8457-133973a5ae50","resolution":{"observed_at":"2026-08-05T11:41:43.225077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11128","last_updated":"2025-09-03T01:59:58Z","snapshot_observed_at":"2026-08-07T18:14:46.399260Z","submitted_at":"2025-02-16T13:54:32Z","title":"FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching","version":2},"cited_work":{"arxiv_id":"2502.11128","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11128","snapshot_observed_at":"2026-08-05T11:41:42.733852Z","title":"FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching","venue":"cs.CL","work_id":"9e0d9a01-b398-47a5-a8fe-71f51be57ef6","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.566443Z"},"links":{"cited_paper":"/paper/2502.11128","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:e89e0317a4247f7fdacd39e485e30f3f2002f46d37eb3c5dc2884fc2e72c1944","observation_id":"3882d03c-8f3b-4384-b0b7-7ac957202b0f","resolution":{"observed_at":"2026-08-05T11:41:42.890538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.204083Z","title":null,"venue":null,"work_id":"9e618bb0-a229-4d7d-b810-f8235e01c9d2","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.660357Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:ec2cde30e5306ab0b69e8b37501b81d9305fa18fc68908f361de0fd027927566","observation_id":"9abecb0d-e6f2-4f8b-8594-6568ab6d476a","resolution":{"observed_at":"2026-08-05T11:41:43.208723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.188935Z","title":null,"venue":null,"work_id":"51b866f9-de6f-4516-a91f-fa0b396879d8","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.756841Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:c43860edfb81a3d4fd07911316b76793490aad05b2e026ae9ecc0554ff21fe60","observation_id":"b36840fc-59f4-4aad-8907-96cba7160fe0","resolution":{"observed_at":"2026-08-05T11:41:43.193509Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.171898Z","title":null,"venue":null,"work_id":"5eb83bc4-31fc-4429-913f-0c4c9755c7f8","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.868703Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:0e18022bd4de06033ce673a17b19124cb81e794ac2e3cb33c2f1c73a1a24c15e","observation_id":"8b9df95c-1821-417f-91b4-a7c6a258c24e","resolution":{"observed_at":"2026-08-05T11:41:43.176985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.154491Z","title":null,"venue":null,"work_id":"20ca281b-718b-4b28-9d14-5f5e62dcb237","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:41.995968Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:e2b140a5ed89cb3cdd2d2b3e8f6554f763aaf790fa8b9fb300eb4488107f9621","observation_id":"bf3842b6-0449-42df-81ef-a06a03cd275e","resolution":{"observed_at":"2026-08-05T11:41:43.159259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.138034Z","title":null,"venue":null,"work_id":"ff611d43-d5ee-4275-b036-37b034bcb65c","year":2025},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:42.125530Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:f6baabe1b19b08fb90c2d19a0b5e9b4df00bf7d8bca98e263e8e3f40274fc677","observation_id":"2b744ac6-aaf2-424a-9d5c-fb2601ff76a8","resolution":{"observed_at":"2026-08-05T11:41:43.143181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.121697Z","title":null,"venue":null,"work_id":"8ed3b5dd-a113-4a85-8f42-a0e69136d867","year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:42.233238Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:97b5f66efb90cf323917fae632bb1ff113138543906d3fdedb50702cc4dfc2b5","observation_id":"e1789211-65e4-4077-840e-30e4b260ce7e","resolution":{"observed_at":"2026-08-05T11:41:43.126932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.105962Z","title":null,"venue":null,"work_id":"e980ab2c-5044-495e-94ab-aa2c38d9cce7","year":2023},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:42.373156Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:a25ef71dcebb42dd5202dcab3997fbbc1abb1c1171f80e0a962d7439a5b102e8","observation_id":"d08cdb9f-cf7c-479b-98c4-9afbd3d314b8","resolution":{"observed_at":"2026-08-05T11:41:43.110527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:41:43.088759Z","title":null,"venue":null,"work_id":"ba1cfd83-7472-4082-9a25-d89ea99a43f0","year":2021},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:42.535356Z"},"links":{"citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:ce62ba19ad5f7e3b460fd8744f04dae2aa0c11185070f991529178d9495a5967","observation_id":"6cec966d-9254-4725-af83-e8ac718d4b64","resolution":{"observed_at":"2026-08-05T11:41:43.093902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04577","last_updated":"2024-03-05T09:12:35Z","snapshot_observed_at":"2026-07-06T17:13:17.263599Z","submitted_at":"2024-01-09T14:29:39Z","title":"Masked Audio Generation using a Single Non-Autoregressive Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04577","snapshot_observed_at":"2026-08-05T11:41:42.630260Z","title":"L.; Remez, T.; Kreuk, F.; Défossez, A.; Copet, J.; Synnaeve, G.; and Adi, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:42.630260Z"},"links":{"cited_paper":"/paper/2401.04577","citing_paper":"/paper/2509.02398"},"observation_digest":"sha256:cb4f51a49424b09223f4000096c3e57479c53cc0cd06b51a957a5094ba127c40","observation_id":"19a3a6ce-5f4d-4403-8478-40003504ead6","resolution":{"observed_at":"2026-08-05T11:41:42.630260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02398","last_updated":"2025-09-02T15:10:09Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T14:04:39.516006Z","submitted_at":"2025-09-02T15:10:09Z","title":"TTA-Bench: A Comprehensive Benchmark for Evaluating Text-to-Audio Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 1 inbound Pith citation observation for arXiv:2509.02398."}