{"as_of":"2026-08-22T21:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c20d04368c49e65c1a653ec152f718c913c56fe4af6d2776bcda90a0f2b6d486","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:41:24.207276Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:41:21.333361Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T21:41:24.430826Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"cited_work":{"arxiv_id":"2506.23582","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23582","snapshot_observed_at":"2026-08-06T21:41:24.430826Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","venue":"cs.SD","work_id":"e4c49d54-dbf5-4ddb-b873-034067a7ae28","year":2025},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.333361Z"},"links":{"cited_paper":"/paper/2506.23582","citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:93cbd1651c84ba08229f0d0f03684cdd0a5ff649977c28629d2b99c7f1f730dc","observation_id":"e9e26b03-e55f-4363-926e-a8e6934b2c7c","resolution":{"observed_at":"2026-08-06T21:41:24.575515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23582/citation-record","integrity":"/paper/2506.23582/integrity","json":"/paper/2506.23582/citation-record.json","paper":"/paper/2506.23582"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:30.427406Z","title":"a dog barking behind a human speech,","venue":null,"work_id":"76930254-74a5-4475-8d96-355d71b7fab8","year":null},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.279386Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:6ded1f7cdfd10c4a7db17e19ce5359298a504053b7ec7acf394dd3da59096437","observation_id":"f56a6ed1-d90d-4f35-9f31-859ccba6066f","resolution":{"observed_at":"2026-08-06T21:41:30.509503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"cited_work":{"arxiv_id":"2506.23582","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23582","snapshot_observed_at":"2026-08-06T21:41:24.430826Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","venue":"cs.SD","work_id":"e4c49d54-dbf5-4ddb-b873-034067a7ae28","year":2025},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.333361Z"},"links":{"cited_paper":"/paper/2506.23582","citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:93cbd1651c84ba08229f0d0f03684cdd0a5ff649977c28629d2b99c7f1f730dc","observation_id":"e9e26b03-e55f-4363-926e-a8e6934b2c7c","resolution":{"observed_at":"2026-08-06T21:41:24.575515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-08-20T12:00:11.254046Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-06T21:41:21.405172Z","title":"Meta Audiobox Aes- thetics: Unified Automatic Quality Assessment for Speech, Music, and Sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.405172Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:1f222e791472b9df7f542200b37cee43246dfc2a778b93b22dc13fbbabb30783","observation_id":"5bceae05-baab-4c89-aa9f-cbc2d88d8296","resolution":{"observed_at":"2026-08-06T21:41:21.405172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:30.258088Z","title":"2” or higher, we added the exclusion of listeners with an average original audio rating of “6","venue":null,"work_id":"2852f425-acc8-48ce-ac5f-7c075ae85ff8","year":null},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.469080Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:c1c677eed534e5a5eded44ac3142a25ead77668d6a4985a0a8fa927d1beb1785","observation_id":"7312557b-8972-4ae4-99b9-a421dd381213","resolution":{"observed_at":"2026-08-06T21:41:30.309407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T21:41:21.575339Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.575339Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:f3fbc4a2681f8b93bce12cd68dcff0e9aa334224c4561a69c903e291f3f2ac5e","observation_id":"bca3e593-4e97-4146-829b-69f2ed23b05f","resolution":{"observed_at":"2026-08-06T21:41:21.575339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:29.906043Z","title":null,"venue":null,"work_id":"4735dc4c-7e34-4803-9aac-8064be7b2d4f","year":null},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.623018Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:3d7eb3dca22736ad26e50ccdc9787e5cac225d7481a872a516014d19856cd75f","observation_id":"9bfb8ae9-087d-49b3-b354-e047c79026ea","resolution":{"observed_at":"2026-08-06T21:41:29.964702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:29.716748Z","title":null,"venue":null,"work_id":"696553d8-3f24-48bb-bbe9-84ddeeb6e29f","year":null},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.684278Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:c136c9880e667da8e5c06dd46c5c740e4976e90696d28ae3ea65a1161d273cef","observation_id":"0854e656-819b-4fdc-8598-263f139e5827","resolution":{"observed_at":"2026-08-06T21:41:29.801710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:28.358079Z","title":"UTMOS: UTokyo-SaruLab system for V oice- MOS Challenge 2022,","venue":null,"work_id":"0d50b1c2-f9e1-465a-960f-b1496c8bc97f","year":2022},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.222125Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:3169a2a71b362dcecde89059d2a6d68769a10bb1609de16f1797d09b0d608451","observation_id":"b1d044a9-a83d-4535-aae2-d532992e074b","resolution":{"observed_at":"2026-08-06T21:41:28.443852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:29.448966Z","title":"Diffsound: Discrete diffusion model for text-to-sound genera- tion,","venue":null,"work_id":"647573a4-9c9b-4ea0-b5cd-6f36b94e8241","year":2023},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.755408Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:7411c50a647330a86b91595832985d6b26ef5f7b12c75803f8ae0dd3c1939ca4","observation_id":"b5648097-787c-462b-a79d-9917e23c3e0b","resolution":{"observed_at":"2026-08-06T21:41:29.572302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:29.212630Z","title":"Sound synthesis for impact sounds in video games,","venue":null,"work_id":"b5747737-04a8-483f-9a6f-03c03e6e0e41","year":2011},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.820308Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:1560d8e213f4af747fbb226284979ef7e293f7ecccd73fd70f72ecd8af01d9c8","observation_id":"0c15c510-645e-4f29-a594-5ed720865bd9","resolution":{"observed_at":"2026-08-06T21:41:29.343842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:29.086782Z","title":"Challenge on sound scene synthe- sis: Evaluating text-to-audio generation,","venue":null,"work_id":"d1060c69-40d7-47b2-b9e4-5d9607592a1b","year":2024},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.868292Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:c155369bd6172048918beb76be4caa5680a281a8115d858fe453fd10cd36e2ed","observation_id":"230d1527-c23a-4766-8c98-9676f450937b","resolution":{"observed_at":"2026-08-06T21:41:29.149522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:28.927738Z","title":"The V oiceMOS Challenge 2024: Beyond speech quality prediction,","venue":null,"work_id":"ca64c30d-1dab-44c9-bdd0-ae8d21469972","year":2024},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.935696Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:5b11f2c596fcb2a50d19451f64e3a9a81d6bd5a11b3792385a3d3e0a57f36eb5","observation_id":"9d038414-0e20-426e-a83e-519bc03d6f4f","resolution":{"observed_at":"2026-08-06T21:41:28.991430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:28.778041Z","title":"Subjective-aligned dataset and metric for text-to-video quality assessment,","venue":null,"work_id":"c8053269-55dd-4a47-bbcf-2cb652926e29","year":2024},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.012364Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:50a6d2e2eafc2b265d4cb02e03ff66b0dfaafc5f4fa240234fea52f3bda42763","observation_id":"575f9da5-92f0-4e6c-8278-bf9af17f6c91","resolution":{"observed_at":"2026-08-06T21:41:28.816240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:28.662251Z","title":"Environmental sound synthesis from vocal imitations and sound event labels,","venue":null,"work_id":"de685c5b-54ff-41f4-97c9-910af7448f09","year":2024},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.082880Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:e6e83244ade284eaa4e3d9f07f35faf626ef6edd5229f9241148b2f90bb1e579","observation_id":"105ac452-f0d2-4310-a374-341099b3a6e2","resolution":{"observed_at":"2026-08-06T21:41:28.698899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:28.509451Z","title":"Make-an-audio: Text-to-audio gen- eration with prompt-enhanced diffusion models,","venue":null,"work_id":"8cf47a2a-5526-42a4-b663-35413cd81fda","year":2023},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.143289Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:a4ee9303299d7a591e7cdb67ceac149b4cc29bf3b0fdd15e4de31164ee9fe6f2","observation_id":"9ccadc8a-8fb6-4579-992f-806bef2474af","resolution":{"observed_at":"2026-08-06T21:41:28.578905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:27.154312Z","title":"Text-to- audio generation using instruction guided latent diffusion model,","venue":null,"work_id":"e7842f1e-6227-4083-acf1-c0ba15321849","year":2023},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.788988Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:b2ded7da525ef9ba3605e42be4f2533e6a962bcd4f8c00583107abfab7d95630","observation_id":"b0ebc53f-c036-4544-a474-bcd78621ca1b","resolution":{"observed_at":"2026-08-06T21:41:27.266852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:22.283957Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.283957Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:becda9e8d520bfb5f4e093d4eab50cbc928e54ef19b619042f23fa23281cf126","observation_id":"12b470e2-c5a9-43ce-904c-3825d3b472df","resolution":{"observed_at":"2026-08-06T21:41:22.283957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:22.352486Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.352486Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:a7071d7d46f30d73d8964aea90ca07140e417d8b051e8c5b8c12de71066a7925","observation_id":"7203e59d-5374-4215-b076-8c93d4ef1fb5","resolution":{"observed_at":"2026-08-06T21:41:22.352486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:30.069925Z","title":"Animal” category shows both of statistically significant differ- ences and interaction. Figure 2(a). shows that synthesized audio in the “Animal","venue":null,"work_id":"192834c2-d668-4e90-b9da-744c33f8ab40","year":null},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:21.515288Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:cd17b3d381b65995b6cec4f810b7fca378f6ea2a0c740a33a7292655e1629af4","observation_id":"66c5ab75-e0cd-4bd2-af30-4519267f34f2","resolution":{"observed_at":"2026-08-06T21:41:30.166092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:28.147396Z","title":"PAM: Prompting audio-language models for audio quality assessment,","venue":null,"work_id":"cd14cd60-842a-4944-b9e9-0264d9ea3e0a","year":2024},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.421792Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:98ef82d2c8fcc3d1a5dd69723c8d8800291f5d1bd27029bb1dee7811a1e4e1fd","observation_id":"6beaa23e-2537-40ab-bcc8-1f182c8af643","resolution":{"observed_at":"2026-08-06T21:41:28.252093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:27.889729Z","title":"Audio-text mod- els do not yet leverage natural language,","venue":null,"work_id":"15829da0-8876-4cb4-be8e-ac97ba2545c5","year":2023},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.493924Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:8599395996e233068676841cf88142e06df977ec24325c8906a148bfc773b133","observation_id":"818e93a2-30ca-4461-b3a1-625b0cfab09d","resolution":{"observed_at":"2026-08-06T21:41:28.017606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:27.699897Z","title":"AudioCaps: Generat- ing captions for audios in the wild,","venue":null,"work_id":"6ee5ad7e-3e6c-4b31-9f4e-459e176f4def","year":2019},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.559383Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:c5d065907fd65f4cf0ae626bca9d37cec91ec2d994b37558c23d7cf083945514","observation_id":"1f895f04-a02e-432f-bfb2-63baf86708a3","resolution":{"observed_at":"2026-08-06T21:41:27.791916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:27.559259Z","title":"AudioLDM: text-to-audio generation with latent diffusion models,","venue":null,"work_id":"08c202b8-5a36-4ad1-a8fe-55db6f5a76fb","year":2023},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.634145Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:e08e959f348911882bc7f2333b13496613fd961239e00d86364f461724580b0c","observation_id":"7dfe310c-937c-4c4f-a7fa-5adb96f9ac70","resolution":{"observed_at":"2026-08-06T21:41:27.637563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:27.411388Z","title":"AudioLDM 2: Learn- ing holistic audio generation with self-supervised pretraining,","venue":null,"work_id":"9e89a81b-6136-41e4-9716-a4ae50ccce5b","year":2024},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.715542Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:893d81195a434f0daea0d5982a2aaf4a5ac61a39e27c704f29b251299e0fcded","observation_id":"df6faa69-4fec-4869-bc10-86d9f8f9d286","resolution":{"observed_at":"2026-08-06T21:41:27.472397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:26.866269Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization,","venue":null,"work_id":"15edbac3-f1e0-4242-81ca-f9ad02e3c757","year":2024},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.873119Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:2755c06a30f206aa3ddc943dd68dfeca0c4dd377c0c49042bee5564b6e254450","observation_id":"dfe3687a-0663-47d7-aca1-27601b5f7a6b","resolution":{"observed_at":"2026-08-06T21:41:27.012471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:26.637388Z","title":"Toward verifiable and repro- ducible human evaluation for text-to-image generation,","venue":null,"work_id":"763b1497-c6ec-4f71-b907-f72ca05cdf09","year":2023},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:22.951084Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:16e8722ba1e2379786a62e757519a936403448a4be4fe7baee3f9892dbee7d9b","observation_id":"11b55f60-ec7d-4e44-80d3-aa24986f3f83","resolution":{"observed_at":"2026-08-06T21:41:26.723656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:23.027753Z","title":"On a test of whether one of two random variables is stochastically larger than the other,","venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:23.027753Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:26e727733bc4a9653c401bf9b40170e5a73acd5674e9939f9fe8ade199c78828","observation_id":"b3b63564-ea32-4c26-af81-d021248b0511","resolution":{"observed_at":"2026-08-06T21:41:23.027753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:23.092781Z","title":"Use of ranks in one-criterion variance analysis,","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:23.092781Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:ebf084627977ce5fead0026c88e61d127613408a8011279e1531413aa31efc0a","observation_id":"d5a36147-225b-454a-b648-d2874a2bb133","resolution":{"observed_at":"2026-08-06T21:41:23.092781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:26.410846Z","title":"A multiple comparison rank sum test: treatments versus control,","venue":null,"work_id":"936f5f91-6410-424c-a1bc-489ad656372b","year":1959},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:23.171413Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:54a0076d6aa6df6d9ad527b24849ae2010b641fe28bb6fb0b43f92aa5dc3741a","observation_id":"7cef4de0-9de5-49ab-bb0c-1693c021e7f6","resolution":{"observed_at":"2026-08-06T21:41:26.509594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:23.280968Z","title":"The aligned rank transform for nonparametric factorial analyses using only anova procedures,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:23.280968Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:38a2e7eddef35ffd7be619436b3ebbea602843827f315ca473660cd1296295d3","observation_id":"76f4c52f-52b0-4d3e-98ec-35c0c826c1b3","resolution":{"observed_at":"2026-08-06T21:41:23.280968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:26.175130Z","title":"A new readability yardstick","venue":null,"work_id":"897830be-6c26-4dbc-9bc2-35bc891af7c6","year":1948},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:23.367652Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:a5829e8924dbb350f1c8b56bc35ea9b20d2858abcb4ed3f84f54af789ce61ffb","observation_id":"a3b6b4a0-01fe-4463-b283-4ca45952e0ed","resolution":{"observed_at":"2026-08-06T21:41:26.272858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:25.979810Z","title":"BYOL for Audio: Exploring pre-trained general-purpose audio representations,","venue":null,"work_id":"3d1e244b-1cd8-487a-a9c1-0dc7900f3c81","year":2022},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:23.462651Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:e04920c36661fc3384c0f3e79b7c85fa892512ba4b370426e51f8d65ffc99118","observation_id":"69676ee5-e695-4454-967e-8d8054546456","resolution":{"observed_at":"2026-08-06T21:41:26.061815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:25.753184Z","title":"LDNet: Unified listener dependent modeling in MOS prediction for syn- thetic speech,","venue":null,"work_id":"7a70116d-9125-4949-8a3c-a011c5a523eb","year":2022},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:23.569795Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:596ad8f9a371876b2426027f528a464d7c6686b6a0655b5a3843579c4edc50ab","observation_id":"c88b6738-ae54-41de-89d5-dd104f49153c","resolution":{"observed_at":"2026-08-06T21:41:25.867292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:25.569365Z","title":"Bidirectional LSTM networks for improved phoneme classification and recog- nition,","venue":null,"work_id":"794607f7-1748-44e0-9caa-73b31d2fc456","year":2005},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:23.667767Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:cb4800e37e6c9d9aea9eeec50bcfa45fedfae8e99b54efac163a7a4d7c58e4cd","observation_id":"59f3a409-d1e9-448e-9e7d-27db25507d18","resolution":{"observed_at":"2026-08-06T21:41:25.655575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:25.444341Z","title":"MBNet: MOS prediction for synthesized speech with mean-bias network,","venue":null,"work_id":"24486e8d-3afa-4f10-95d7-8c28505d0562","year":2021},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:23.793918Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:fa6d56c8ac4dc6c330f30c10edbd45e36f9fcb41755240f00a09aedb6526219e","observation_id":"32ee808a-97fb-44d5-8245-2d40a7161a49","resolution":{"observed_at":"2026-08-06T21:41:25.520959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:25.280231Z","title":"Class- balanced loss based on effective number of samples,","venue":null,"work_id":"77fc7f55-0529-45bf-81f2-98b55e995dab","year":2019},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:23.906898Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:359e5f11570ba69234d3453809020558ffa65bbbf282324bd001aa2892c4f546","observation_id":"e5344c90-5046-4c45-baad-848b36ecb386","resolution":{"observed_at":"2026-08-06T21:41:25.345388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:25.092151Z","title":"Adam: A method for stochastic op- timization,","venue":null,"work_id":"894f04a0-1bc0-450c-84a6-4af44b6607a5","year":2015},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:24.002568Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:b3bf3d30de1da9c772c9422708a50e1f9747c95ad394437fb2275264f64ed5a6","observation_id":"b81dd3f9-befc-4967-a864-b4569594cff9","resolution":{"observed_at":"2026-08-06T21:41:25.181627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:24.892042Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"1fbe1cee-7ebd-4cd6-a045-22076df462fb","year":2023},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:24.119652Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:3886a858bdce3faeca703f434936c2f141d82a6e21a07a4014e1178b25b67514","observation_id":"59903483-f256-4b56-ac5b-656a59630b3b","resolution":{"observed_at":"2026-08-06T21:41:24.966345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:24.709343Z","title":"CLAP: Learning audio concepts from natural language supervision,","venue":null,"work_id":"ec8fe6e2-5228-4968-bdf0-379922e43ebd","year":2023},"citing_paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:24.207276Z"},"links":{"citing_paper":"/paper/2506.23582"},"observation_digest":"sha256:069b9cd1c3e20db019962192858538b17e5a2ee0b42d40e34e33117dfa5e0c56","observation_id":"2115d22c-8f3f-41b3-8b74-39f0a190b9de","resolution":{"observed_at":"2026-08-06T21:41:24.796055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23582","last_updated":"2025-06-30T07:36:28Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T17:55:21.748234Z","submitted_at":"2025-06-30T07:36:28Z","title":"RELATE: Subjective evaluation dataset for automatic evaluation of relevance between text and audio"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2506.23582."}