{"as_of":"2026-08-19T18:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e11aa26201ec6d044aa905297f0d2ae81a6bb669eedf4e289ac495b111475de7","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:57:47.433651Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:57:47.249767Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T04:57:47.830028Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"cited_work":{"arxiv_id":"2504.21815","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.21815","snapshot_observed_at":"2026-08-16T04:57:47.830028Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","venue":"eess.AS","work_id":"9c7e5415-d369-4b4d-9ba4-e904016f2e1a","year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.249767Z"},"links":{"cited_paper":"/paper/2504.21815","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:41673f05ba43ca8b53fdac2b20abdbd9b2f80bae8cab3fbd680df96886be9eed","observation_id":"6d90708e-c42e-408a-b0ac-d99b91e74eb1","resolution":{"observed_at":"2026-08-16T04:57:47.834783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.21815/citation-record","integrity":"/paper/2504.21815/integrity","json":"/paper/2504.21815/citation-record.json","paper":"/paper/2504.21815"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.211372Z","title":null,"venue":null,"work_id":"4b26a7ae-27c9-43f5-8bbc-b3ab58245d9e","year":null},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.244102Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:a6263d44f31baa7560a1548ab28d6e329ab23363a92d0ad00f28898632cdb112","observation_id":"4cf1924a-2025-401e-a7b6-1796ad82b4e8","resolution":{"observed_at":"2026-08-16T04:57:48.215884Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"cited_work":{"arxiv_id":"2504.21815","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.21815","snapshot_observed_at":"2026-08-16T04:57:47.830028Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","venue":"eess.AS","work_id":"9c7e5415-d369-4b4d-9ba4-e904016f2e1a","year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.249767Z"},"links":{"cited_paper":"/paper/2504.21815","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:41673f05ba43ca8b53fdac2b20abdbd9b2f80bae8cab3fbd680df96886be9eed","observation_id":"6d90708e-c42e-408a-b0ac-d99b91e74eb1","resolution":{"observed_at":"2026-08-16T04:57:47.834783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.197679Z","title":null,"venue":null,"work_id":"010ff2dd-da16-4c60-b3f9-172b6dbcc7e3","year":null},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.255187Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:495ae17e97326042b9c5f4d70f4ff358973f0fac031dbfa930a5adaf654f928a","observation_id":"a677cbcd-5180-4be5-a9bd-baa87ef75644","resolution":{"observed_at":"2026-08-16T04:57:48.202200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.183408Z","title":"low quality","venue":null,"work_id":"2ea9d168-5d31-43c8-9857-8d53cba371ba","year":null},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.259974Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:33ff8d68707b78e984b35e28fbbd661bf87804d65d35db209248a16a90366246","observation_id":"cc880505-c91d-4713-ba40-49d21a8370b6","resolution":{"observed_at":"2026-08-16T04:57:48.187932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.169512Z","title":"We examine reference-based evaluation metrics on the generated dataset computed in Section 4, offering a complementary perspective to subjective assessments","venue":null,"work_id":"b7ba0f73-ce15-414a-86cf-a5c2d66556e9","year":null},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.265373Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:afb52d9a792c42c054eb7946aae9544777f007e20b2f2432d33954c6262370c0","observation_id":"f5756c59-4e1f-441c-938f-2c2b27cdce4e","resolution":{"observed_at":"2026-08-16T04:57:48.174473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.155402Z","title":"Our results reveal substantial incon- sistencies between different evaluation perspectives, highlighting the challenges of fully capturing human judgment through automated proxies","venue":null,"work_id":"ec4a3842-9b82-4714-9e5e-93275760e8f2","year":null},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.270241Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:2214e103f4d5d097d220aaff4fc0f3f12d04a79e204c803ba6f11dfd295a985b","observation_id":"748cb1b8-505f-46c1-8363-626873488520","resolution":{"observed_at":"2026-08-16T04:57:48.160227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.141446Z","title":"Acoustic scene generation with condi- tional SampleRNN,","venue":null,"work_id":"d438eb9a-6d69-4167-b488-3df7b79d2d49","year":2019},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.274640Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:ad8a62677cf588c0152292cc8a1b4ac7c3a69fc0e0ed8fbb8614430c5a630ce8","observation_id":"4cad6a93-1e79-487a-961c-8255a4a1b058","resolution":{"observed_at":"2026-08-16T04:57:48.146152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.127950Z","title":"AudioGen: Textually guided audio genera- tion,","venue":null,"work_id":"308ba4e5-30c7-43d1-a020-941b9dc2129a","year":2023},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.279168Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:338ce4ea877ae929d70e66c23cbe905c488d0aab519dd9fb1b4e255d337133ca","observation_id":"1ec9efc9-90c6-45da-99da-6d7fb5062a42","resolution":{"observed_at":"2026-08-16T04:57:48.132578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.113456Z","title":"DExter: Learning and Controlling Performance Expression with Diffusion Models,","venue":null,"work_id":"db6379e2-3398-4a38-9de4-09e2ac9db4f3","year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.283916Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:faf72497a55c1d046e7e747d5ed6a041a35da2cefd7a9ad3c1249c2ccb1831d5","observation_id":"263790c9-df72-4cc2-b01e-e74fa0af038f","resolution":{"observed_at":"2026-08-16T04:57:48.118563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T04:57:47.288199Z","title":"DeepSeek-R1: Incentivizing reasoning capa- bility in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.288199Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:de56f454a1b247a75bebfe1f73a7cf62c832b829555b9d48d71af49e529340ae","observation_id":"e15067ec-328f-4ba1-a97f-963ca8c703f6","resolution":{"observed_at":"2026-08-16T04:57:47.288199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-16T04:57:47.293130Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.293130Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:d886714609fbb04e3a367e7ee1da8daa89cf85f2a47224aff201bec0916ad502","observation_id":"dea05df3-4aa9-463e-90b1-868cb15c4b7f","resolution":{"observed_at":"2026-08-16T04:57:47.293130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.099308Z","title":"DSPO: Direct score preference optimization for diffusion model align- ment,","venue":null,"work_id":"190c3da3-8093-4e09-b485-0f4bc6a2307f","year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.298409Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:9d523749726db233a20fa9dd0251f78b2ec72647dd4a8cfe364d7270ee9d8f44","observation_id":"21984b2c-a8a6-4ea1-b1a0-66d8afc92516","resolution":{"observed_at":"2026-08-16T04:57:48.104139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-16T04:57:47.302806Z","title":"Seed-TTS: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.302806Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:d01959597199c0f91600e418275336aa4dceb4ecb67c18774fd839c166559834","observation_id":"0a4454cb-d7b0-496d-835e-1e617e964cd5","resolution":{"observed_at":"2026-08-16T04:57:47.302806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.086072Z","title":"1, Association for Computing Machinery, 2024","venue":null,"work_id":"572d7fdc-7909-48ed-8492-6ac585f25116","year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.307649Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:293058ec79e6feed73410a88f5aa5f04be8d44e71153af7de56d293b0ae2d776","observation_id":"97b67597-354f-4ca0-a053-4efa3937514b","resolution":{"observed_at":"2026-08-16T04:57:48.090417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.072379Z","title":"BATON: Aligning text-to-audio model using human preference feedback,","venue":null,"work_id":"b01fba01-0690-4f61-a848-15fc3773e029","year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.311697Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:412872106436bf64777ee8eba8d1fc7842215261abb6eb9cecdcbec13add4010","observation_id":"04fec364-3565-464e-8d24-9d25be516a88","resolution":{"observed_at":"2026-08-16T04:57:48.076969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.315838Z","title":"DRAGON: Distributional rewards optimize diffusion generative models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.315838Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:9f4e0caad18458934162e47b4e397142c9c3799f04cb11a7118038000d1db85f","observation_id":"270de9c1-f454-41b2-9ba2-b54894bab1ae","resolution":{"observed_at":"2026-08-16T04:57:47.315838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16839","last_updated":"2025-04-23T16:02:25Z","snapshot_observed_at":"2026-08-17T16:16:17.167969Z","submitted_at":"2025-04-23T16:02:25Z","title":"SMART: Tuning a symbolic music generation system with an audio domain aesthetic reward","version":1},"cited_work":{"arxiv_id":"2504.16839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.16839","snapshot_observed_at":"2026-08-16T04:57:47.702494Z","title":"SMART: Tuning a symbolic music generation system with an audio domain aesthetic reward","venue":"cs.SD","work_id":"2c3f192d-f36c-49ef-97e6-dc193b6116ae","year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.320069Z"},"links":{"cited_paper":"/paper/2504.16839","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:b95ad0767ae4af2ecada647e1633b49e623b92784f016cbcca56487b15d1d485","observation_id":"bf4d53e4-f123-46d0-83fa-e685f3268f87","resolution":{"observed_at":"2026-08-16T04:57:47.709388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16669","last_updated":"2025-03-20T19:31:04Z","snapshot_observed_at":"2026-08-18T12:36:37.103529Z","submitted_at":"2025-03-20T19:31:04Z","title":"Aligning Text-to-Music Evaluation with Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16669","snapshot_observed_at":"2026-08-16T04:57:47.324607Z","title":"Aligning text-to-music evaluation with human pref- erences,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.324607Z"},"links":{"cited_paper":"/paper/2503.16669","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:affe6f8a800eb9f24e78db7773f85f3121ff9054312333be7a87d17fbdf0d104","observation_id":"9858a7fc-3339-4148-9bae-3beae96a5fad","resolution":{"observed_at":"2026-08-16T04:57:47.324607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15602","last_updated":"2025-03-09T06:46:13Z","snapshot_observed_at":"2026-08-19T07:51:08.867602Z","submitted_at":"2025-02-21T17:19:15Z","title":"KAD: No More FAD! An Effective and Efficient Evaluation Metric for Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15602","snapshot_observed_at":"2026-08-16T04:57:47.329053Z","title":"KAD: No more FAD! An effective and efficient evaluation metric for audio generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.329053Z"},"links":{"cited_paper":"/paper/2502.15602","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:9e3cd450518c8da35c138a2c12ed6d528fbddbed2ecaf989e282a9f40657363c","observation_id":"a78cb8af-1d39-436a-8cd2-25fcb146a866","resolution":{"observed_at":"2026-08-16T04:57:47.329053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.058111Z","title":"WavCraft: Audio editing and generation with large language models,","venue":null,"work_id":"a1831058-e689-4b80-bfe9-e167be11d4c5","year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.333481Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:d1e80e2acf16d7e6876d6a25abc92cc03e57a34bd09ee9b07003c02c310a8042","observation_id":"3b40369f-1a92-466d-8fc3-8383255a9adf","resolution":{"observed_at":"2026-08-16T04:57:48.063073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.044594Z","title":"WavJourney: Compositional audio creation with large language models,","venue":null,"work_id":"f6bd0b04-e656-4985-8a94-88ff990d8f45","year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.337921Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:86e518ffe40e48cbbe6f10e02f7bd48dfc0af1573053e7915006c483f62af7b9","observation_id":"6a11a3b2-b24f-4853-87a4-2747096b6ca4","resolution":{"observed_at":"2026-08-16T04:57:48.048898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07827","last_updated":"2024-09-12T08:19:25Z","snapshot_observed_at":"2026-08-18T17:54:55.254128Z","submitted_at":"2024-09-12T08:19:25Z","title":"Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07827","snapshot_observed_at":"2026-08-16T04:57:47.342303Z","title":"Bridging paintings and music – exploring emotion based music genera- tion through paintings,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.342303Z"},"links":{"cited_paper":"/paper/2409.07827","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:06baed072394413aaf152f0f4055281db4434a61d0224b9ac892582f4eeb0e25","observation_id":"1216f0f5-e14e-4400-9816-8a87becf1229","resolution":{"observed_at":"2026-08-16T04:57:47.342303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08155","last_updated":"2024-09-12T15:51:09Z","snapshot_observed_at":"2026-08-16T19:49:31.026687Z","submitted_at":"2024-09-12T15:51:09Z","title":"Hierarchical Symbolic Pop Music Generation with Graph Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08155","snapshot_observed_at":"2026-08-16T04:57:47.346856Z","title":"Hierarchical symbolic pop music generation with graph neural networks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.346856Z"},"links":{"cited_paper":"/paper/2409.08155","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:8d646e68d6fb62ebeebb3f56e68cff25311e033f4a9ebcf7bfe5a98c48d618c2","observation_id":"fe47a6b5-73ee-402c-b1a6-0c9ebede57bb","resolution":{"observed_at":"2026-08-16T04:57:47.346856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07711","last_updated":"2025-02-11T17:10:31Z","snapshot_observed_at":"2026-08-16T15:26:56.673287Z","submitted_at":"2025-02-11T17:10:31Z","title":"RenderBox: Expressive Performance Rendering with Text Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07711","snapshot_observed_at":"2026-08-16T04:57:47.351237Z","title":"Render- box: Expressive performance rendering with text control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.351237Z"},"links":{"cited_paper":"/paper/2502.07711","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:42b099359d0849da36d39c7b0199b533f485308318d7685421e5b76be7521bae","observation_id":"2943ddd5-9d71-441b-bef7-e8db6ebeeb4b","resolution":{"observed_at":"2026-08-16T04:57:47.351237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.030469Z","title":"Leveraging pre-trained audioldm for sound generation: A benchmark study,","venue":null,"work_id":"f750079f-d94c-4a58-b8b2-b72be257c797","year":2023},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.355679Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:ce0a250dc19e37e3574f3c10fee10223d13b9d2ec4e448f845870ff152237fc0","observation_id":"1f301de7-9b12-4a39-abe0-7b2b434be3fc","resolution":{"observed_at":"2026-08-16T04:57:48.034883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.016605Z","title":"Diffsound: Discrete diffu- sion model for text-to-sound generation,","venue":null,"work_id":"186785ba-c82c-4220-b5a9-6d8ae0248cde","year":2023},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.360127Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:96ceec49b89b7571ef304cca95814052186ebc5c5ae3697aad9a5e5cabe337a0","observation_id":"4d29258e-06ab-4c71-87a2-4e204c684abf","resolution":{"observed_at":"2026-08-16T04:57:48.021286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:48.002983Z","title":"Adapting frechet audio distance for generative music evaluation,","venue":null,"work_id":"d0b5a981-d0ad-484b-abb4-f9a9ab9fd44d","year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.364505Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:1d24c4c7e5ed26ce8508d54fd94f370fc90ce989c8d64f5159f7dbfa663b8cd8","observation_id":"6b059db3-0c0e-465d-9a3b-635fc6f088b5","resolution":{"observed_at":"2026-08-16T04:57:48.007803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.989166Z","title":"Zero-shot unsupervised and text-based audio editing using DDPM inversion,","venue":null,"work_id":"c86d12a7-a5c1-4003-a7f9-75e2291fc23a","year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.368632Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:c2a2f5ef0714208d3ae715f22f305dc646d221119ac7b1bf4058a9a995be4090","observation_id":"55d0523a-c8ad-4a58-8426-2b6794426a8a","resolution":{"observed_at":"2026-08-16T04:57:47.993797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.975696Z","title":"AudioMorphix: Training-free audio editing with diffu- sion probabilistic models,","venue":null,"work_id":"f699d178-bbeb-4311-a6d4-e999d9f8f395","year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.372707Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:8d00254f2b1b7dd4af77581d474da68e9160e0c9a97b025d7414f3751dfd2d49","observation_id":"09b81ee9-7b6f-4e12-9723-5b6787abab2b","resolution":{"observed_at":"2026-08-16T04:57:47.980370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.961563Z","title":"A comparison of deep learning MOS pre- dictors for speech synthesis quality,","venue":null,"work_id":"f18ce329-4d21-4ef5-ab67-e632aac76f3b","year":2023},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.377051Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:76d871f11083d9f30da9defaea609a982db0b8e84df1fc36a3b257edefa3955a","observation_id":"ad3c2866-b980-487e-ab89-467c7df63f34","resolution":{"observed_at":"2026-08-16T04:57:47.965893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-08-17T16:15:29.907985Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-16T04:57:47.381234Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.381234Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:a096a2d75a8e7634c16f3c55a2c3654e9e807131696c1ae380f623bf4a2fc204","observation_id":"1558adc6-5a1b-4109-83b4-9dde11ff723e","resolution":{"observed_at":"2026-08-16T04:57:47.381234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.947312Z","title":"From Audio Encoders to Piano Judges: Benchmarking Performance Under- standing for Solo Piano,","venue":null,"work_id":"ae616d71-2850-4ad7-a40f-e982ee3e371f","year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.385669Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:689bd5becc2347d0ec378b95232364e532e526169ec6e99fadb7858b714dc28e","observation_id":"e846aac5-a3a4-4cd6-8382-3a1863dbbf31","resolution":{"observed_at":"2026-08-16T04:57:47.952196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.933048Z","title":"Piano Skills Assessment,","venue":null,"work_id":"fdfd1632-9ed8-455c-b2bf-79ad732cd7bf","year":2021},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.389788Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:72fa731c8b4454e6f8ea0c3018f620663582f213e041df9c2e97afb4e2b590a2","observation_id":"dda5b3b9-e940-4e24-916c-524783aad0f3","resolution":{"observed_at":"2026-08-16T04:57:47.937513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.918869Z","title":"LLaQo: Towards a Query-Based Coach in Expressive Music Performance Assessment,","venue":null,"work_id":"58fc6dce-ee39-49ea-bd1c-0978dbf89b1d","year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.394180Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:1618cf04d84da995e08aaeeb4328a0e4c3809d677c04e35186b06ee18c64b6d8","observation_id":"998adf1f-4074-453f-bba7-18b6777c6225","resolution":{"observed_at":"2026-08-16T04:57:47.923524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10811","last_updated":"2025-03-24T02:05:18Z","snapshot_observed_at":"2026-08-18T18:51:14.782062Z","submitted_at":"2025-01-18T16:21:03Z","title":"MusicEval: A Generative Music Dataset with Expert Ratings for Automatic Text-to-Music Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10811","snapshot_observed_at":"2026-08-16T04:57:47.398280Z","title":"MusicEval: A generative music dataset with expert ratings for automatic text-to-music evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.398280Z"},"links":{"cited_paper":"/paper/2501.10811","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:a87deb7df43083075149f8bbf21f2642ae1e45adf2a7ed0a10525c3b2e516e3d","observation_id":"8e010328-1240-4842-8bea-849015f58b41","resolution":{"observed_at":"2026-08-16T04:57:47.398280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.903118Z","title":"How does the teacher rate? Observations from the NeuroPiano dataset,","venue":null,"work_id":"762a3da6-652f-44c7-a132-b6601769446d","year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.402747Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:1f3727b30a9fdccefbff2c3fe0dc3eebb53ead85dddeaf53bb5f91ed3c3a59c1","observation_id":"c6744b11-d13b-4c25-896e-f467dc0231f9","resolution":{"observed_at":"2026-08-16T04:57:47.908177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.888314Z","title":"Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation,","venue":null,"work_id":"55f104c9-bdf9-414f-98f6-27d36ee757f3","year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.407376Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:cc2d9cf314c7e821c9db04d15291b31b18a7f037ff4af6fbaa015b039116a1ee","observation_id":"3f4fcfd6-91c2-40c6-9266-2dc96d8a1da0","resolution":{"observed_at":"2026-08-16T04:57:47.893180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-16T13:32:41.679971Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-16T04:57:47.411635Z","title":"Stable Audio Open,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.411635Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:2c20ff4c5ea06c1a4ae26fbcf5e97e1ad342938fd15e119dc4a4e1b9304dfe17","observation_id":"84a339d1-68ee-441f-86ed-c914ee47a8ff","resolution":{"observed_at":"2026-08-16T04:57:47.411635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.874101Z","title":"Simple and controllable music generation,","venue":null,"work_id":"a41a5804-a37d-4f7e-8490-e030e9c0b9ab","year":2023},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.416011Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:5c36256bfacff0d4c8bf0db4fb9ab47813afc2ca569e787e4a0ab49c191abe6c","observation_id":"19aed1bd-d670-4ec6-b619-7e7231e7a0aa","resolution":{"observed_at":"2026-08-16T04:57:47.878743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.420722Z","title":"Yue: Scaling open foundation models for long-form music generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.420722Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:bd7a1f44467fd86a5a5f07614d870471952ad553d7aeecf398e7e0426b97fbc9","observation_id":"576d0a2c-d804-4a90-8709-69a1647f8eed","resolution":{"observed_at":"2026-08-16T04:57:47.420722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01183","last_updated":"2025-03-03T05:15:34Z","snapshot_observed_at":"2026-08-18T09:40:58.694553Z","submitted_at":"2025-03-03T05:15:34Z","title":"DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01183","snapshot_observed_at":"2026-08-16T04:57:47.425009Z","title":"DiffRhythm: Blazingly fast and embarrassingly simple end-to-end full- length song generation with latent diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.425009Z"},"links":{"cited_paper":"/paper/2503.01183","citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:5ee806823e1b3ca37aeda20f786209a5e0e7147292cd2b78eef9e51248a3788b","observation_id":"012bcc6c-7aa6-46ec-8959-cd14eaf12736","resolution":{"observed_at":"2026-08-16T04:57:47.425009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.859522Z","title":"LP-MusicCaps: LLM-based pseudo music captioning,","venue":null,"work_id":"3bd03614-fb91-4ac4-8f1e-82891eb9b491","year":2023},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.429436Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:b7dad16a454ea384368a9a10408c1b83cf95c2000df897d8d1182d133541a3ce","observation_id":"64e66076-b27c-452f-81ff-b8209cd95143","resolution":{"observed_at":"2026-08-16T04:57:47.864251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:57:47.844630Z","title":"PANNs: Large-scale pre- trained audio neural networks for audio pattern recognition,","venue":null,"work_id":"703eb25f-8d5c-4d77-a500-aeeb54576527","year":2020},"citing_paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:57:47.433651Z"},"links":{"citing_paper":"/paper/2504.21815"},"observation_digest":"sha256:89d476d5ea5ca5e7a94700cc5c2daacca2063f58e2de74f6be6da7fa3645ad43","observation_id":"b11a7715-a5a8-4d16-a5a2-6f7b40aeebd0","resolution":{"observed_at":"2026-08-16T04:57:47.849442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.21815","last_updated":"2025-04-30T17:21:04Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T15:27:29.842542Z","submitted_at":"2025-04-30T17:21:04Z","title":"From Aesthetics to Human Preferences: Comparative Perspectives of Evaluating Text-to-Music Systems"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2504.21815."}