{"as_of":"2026-08-08T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb2ad8973fce91ab528ba9952829f5d1252f112055f9f84854220912a05e80b1","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:16:56.451078Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05899/citation-record","integrity":"/paper/2506.05899/integrity","json":"/paper/2506.05899/citation-record.json","paper":"/paper/2506.05899"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-07T10:16:54.146491Z","title":"Musiclm: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.146491Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:2f963c9047df6521ffaad6467c34e46ab63f642f892bdea58f2a1fc8992101ec","observation_id":"7bc31a3e-2706-46af-8798-ee2fc057ec8a","resolution":{"observed_at":"2026-08-07T10:16:54.146491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-07T10:16:54.194385Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.194385Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:35e9d33411c5141db2b3d305152236e4d3532a5da5262944d92ab70002bc501f","observation_id":"ad315d80-4b72-4627-83d5-86978052c1e7","resolution":{"observed_at":"2026-08-07T10:16:54.194385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:59.548016Z","title":"Fast timing- conditioned latent audio diffusion,","venue":null,"work_id":"83c70d40-e7b3-4dea-8b51-c7bf68cc4258","year":2024},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.243298Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:d2d8aed0148476e2e84e03a33b114de26817dfc21dd9af01830bf201ebfefe0a","observation_id":"bcc3cde5-97b3-4695-8872-6c514b116744","resolution":{"observed_at":"2026-08-07T10:16:59.613505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:59.384128Z","title":"Musiceval: A generative music dataset with expert ratings for automatic text-to-music evaluation,","venue":null,"work_id":"4f0969bb-9ccd-487e-8c21-c4eaccff39a7","year":2025},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.337412Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:7a9af82557a2a73e19ddb34300db2faed3a6b1237454a42f766f84aae9e41505","observation_id":"c2eda0e4-5e05-4345-8d6b-d655fcd3f419","resolution":{"observed_at":"2026-08-07T10:16:59.450106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:59.248724Z","title":"SSL-MOS: A Self-Supervised Learning Based Approach with A Transformer Target Model For MOS Pre- diction,","venue":null,"work_id":"6f2934bc-d9f7-48ff-8f93-5232006baed7","year":2024},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.454075Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:2c1ca89cd99813d126005c8d18cc87335b3407e9fe09727b5d51211423869eb4","observation_id":"faae7500-a287-40ef-b230-0f8e7653af5a","resolution":{"observed_at":"2026-08-07T10:16:59.291059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:59.108455Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"a3525554-ab62-4585-b555-4152c67ed63d","year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.513674Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:51d3885537476f7622eaf545eb6621218c780b52c81e35061fb8bcf7ad276699","observation_id":"c88a3958-4fb3-4d70-9463-13037c7bb64e","resolution":{"observed_at":"2026-08-07T10:16:59.161316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:58.970510Z","title":"MOSNet: Deep learning based objective assessment for voice conver- sion,","venue":null,"work_id":"ac03f78c-439e-4fdb-8f60-cd9e19dd9538","year":2019},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.583734Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:2a5492758f4de107ad75f2995ea46bb0e874ffae0139ef72b0519be52ae3805f","observation_id":"009ebc16-5eae-417e-a12e-54ec420aee6e","resolution":{"observed_at":"2026-08-07T10:16:59.028276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:54.648042Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.648042Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:f9764afeed99bee77871185cbaa307e77a3005c13ddcbbab5cb032b4723d3754","observation_id":"9d4e82e1-9659-4400-b67a-79047a6b82c5","resolution":{"observed_at":"2026-08-07T10:16:54.648042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T10:16:54.739123Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.739123Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:9d52f9d9c5b3ca7d59c4449696b486d6a45dead6be82ecfaf4c5c95670a06c1c","observation_id":"ab3abf6f-2794-4f18-af57-8b4cd7e9445c","resolution":{"observed_at":"2026-08-07T10:16:54.739123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:58.821717Z","title":"Efficient optimal transport algorithm by accelerated gradient descent,","venue":null,"work_id":"1fb48336-d0e7-41ad-8cbb-2ec75562cbee","year":2022},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.811164Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:d8900d8ed2acda2dbda4a4922d1448bd27fdf8a911786591ffbb3132bcd75111","observation_id":"f12e455d-4998-41ec-b50a-b64df0ffd3f0","resolution":{"observed_at":"2026-08-07T10:16:58.868162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:54.921831Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:54.921831Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:1bb3ebc12237e39befa91c3e8f7214856cbb59395ac841d62acd276081533a9f","observation_id":"eceb604f-d319-4102-b005-320ad57c850d","resolution":{"observed_at":"2026-08-07T10:16:54.921831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-07T10:16:55.010659Z","title":"Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.010659Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:19d10f396547b0f10c1427cd4b0ab5056d4f07cfa0269a86287ca0cee222dac3","observation_id":"2fb0be64-6805-4edd-bb43-a0989960304e","resolution":{"observed_at":"2026-08-07T10:16:55.010659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:58.648516Z","title":"Simple and controllable music generation,","venue":null,"work_id":"02b8f7da-db25-4762-a853-af36437b5cc4","year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.126990Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:5b9477d3596646db46c7835fa0754024796509c5f77514a880a60a60218c3db8","observation_id":"6cf873c1-3055-466d-8794-ed5457ae00cb","resolution":{"observed_at":"2026-08-07T10:16:58.722622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:58.438131Z","title":"Mo ˆusai: Efficient text-to-music diffusion models,","venue":null,"work_id":"8aa672ce-ea2b-4773-aed7-cb7014309b39","year":2024},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.247126Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:9f9f88e1c75babb039776684d57b1e4e378f72d7f14548a56ee27a92342f5d2c","observation_id":"b117bfbd-7da0-466e-a6db-321892dbb1ee","resolution":{"observed_at":"2026-08-07T10:16:58.515398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:58.288278Z","title":"Musicmagus: Zero-shot text-to-music editing via diffu- sion models,","venue":null,"work_id":"995879ac-59f3-4d45-9441-a42fcbef94cb","year":2024},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.371848Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:893ce3299bc710b0c4ef8f35cfde28ec1412cc7e218596fd0bc03c3bbb04f05e","observation_id":"110b80d9-f855-4f71-a97d-7964703822bf","resolution":{"observed_at":"2026-08-07T10:16:58.341182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03648","last_updated":"2024-10-16T14:24:53Z","snapshot_observed_at":"2026-07-06T18:41:18.308899Z","submitted_at":"2024-07-04T05:38:49Z","title":"High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03648","snapshot_observed_at":"2026-08-07T10:16:55.490675Z","title":"High fidelity text-guided music generation and editing via single-stage flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.490675Z"},"links":{"cited_paper":"/paper/2407.03648","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:3eb7538939fbea14d8775a21e0364d0fe63adeca0b2c785472995d1bd42b2d36","observation_id":"32b714ee-bd08-48cd-a7fa-e2067ef54485","resolution":{"observed_at":"2026-08-07T10:16:55.490675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01546","last_updated":"2023-08-03T05:35:37Z","snapshot_observed_at":"2026-07-06T16:01:58.161047Z","submitted_at":"2023-08-03T05:35:37Z","title":"MusicLDM: Enhancing Novelty in Text-to-Music Generation Using Beat-Synchronous Mixup Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01546","snapshot_observed_at":"2026-08-07T10:16:55.607323Z","title":"Musicldm: Enhancing novelty in text-to-music generation using beat-synchronous mixup strategies,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.607323Z"},"links":{"cited_paper":"/paper/2308.01546","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:fa38c03fd5db8480db0bf83f0a0fc8dd75a80c0a3de9b10480e09093d2dbb127","observation_id":"948aa870-0d5d-40a3-8c25-d567d71de983","resolution":{"observed_at":"2026-08-07T10:16:55.607323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:58.060688Z","title":"Mospc: Mos prediction based on pairwise comparison,","venue":null,"work_id":"02ffd010-14d1-4470-a2c0-0e52e55eaac3","year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.727593Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:66eed4296f18082d6bb9097136a5565b7b06f55f736840f300ad8eeeabbf0287","observation_id":"fcda9ac2-ff87-4e34-9b23-1215077a15cb","resolution":{"observed_at":"2026-08-07T10:16:58.187547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:57.773083Z","title":"Resource-efficient fine- tuning strategies for automatic mos prediction in text-to-speech for low- resource languages,","venue":null,"work_id":"21d4ff57-9202-43d1-bacc-67ade25cf4d3","year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.786881Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:579a56761c04d8d1f8c082e6dac777e1ba0d4641769ba627944d5f2d5015dacf","observation_id":"e78a8927-adc8-4697-9afa-7ca3b1b274bc","resolution":{"observed_at":"2026-08-07T10:16:57.910254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:57.538744Z","title":"Zero- shot out-of-domain is no joke: Lessons learned in the voicemos 2023 challenge,","venue":null,"work_id":"748a6ef4-bcb8-4844-bc1c-c38b5b11f36f","year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:55.905504Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:c08dd8f84156b7b2b7591b88a7d22208fbabb1b5626c517ede12a5db48609032","observation_id":"622b45c8-a352-4575-9197-7d1cc3bbd279","resolution":{"observed_at":"2026-08-07T10:16:57.645210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20447","last_updated":"2025-04-29T05:45:09Z","snapshot_observed_at":"2026-08-07T15:58:21.855370Z","submitted_at":"2025-04-29T05:45:09Z","title":"APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20447","snapshot_observed_at":"2026-08-07T10:16:56.066230Z","title":"Apg-mos: Auditory percep- tion guided-mos predictor for synthetic speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:56.066230Z"},"links":{"cited_paper":"/paper/2504.20447","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:c6e75a5836b90f22640aa3b87f3acfca01c96b17548baefd9054aed8af93e2d5","observation_id":"83e39c97-ec97-486e-a77b-473dd56ec2ef","resolution":{"observed_at":"2026-08-07T10:16:56.066230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09291","last_updated":"2025-03-15T12:38:50Z","snapshot_observed_at":"2026-08-05T03:11:14.295782Z","submitted_at":"2025-01-16T04:53:29Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","version":2},"cited_work":{"arxiv_id":"2501.09291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09291","snapshot_observed_at":"2026-08-07T10:16:56.891207Z","title":"LAVCap: LLM-based Audio-Visual Captioning using Optimal Transport","venue":"cs.MM","work_id":"08482a98-9bb9-4481-b462-647de195b437","year":2025},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:56.175634Z"},"links":{"cited_paper":"/paper/2501.09291","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:a148e1554423896034d3f4bcf39abc222c1d663aab87cbe54d4d06cba167d5d1","observation_id":"0e99131c-60e1-43be-b897-8b27fd569fc6","resolution":{"observed_at":"2026-08-07T10:16:57.039584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13880","last_updated":"2025-05-27T09:36:03Z","snapshot_observed_at":"2026-08-07T15:42:34.315042Z","submitted_at":"2025-05-20T03:34:53Z","title":"U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding","version":3},"cited_work":{"arxiv_id":"2505.13880","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13880","snapshot_observed_at":"2026-08-07T10:16:56.616742Z","title":"U-SAM: An audio language Model for Unified Speech, Audio, and Music Understanding","venue":"eess.AS","work_id":"e1691a71-5f25-4264-8914-f18d568cdda0","year":2025},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:56.294362Z"},"links":{"cited_paper":"/paper/2505.13880","citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:ab8c6bd5454c553be597fdfcee41bae9f19323fc9ffdf904c424bd9e17ea79aa","observation_id":"44d951d0-8696-4fcf-921d-c7575a48ecc7","resolution":{"observed_at":"2026-08-07T10:16:56.749500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:16:57.281530Z","title":"Cmot: Cross-modal mixup via optimal transport for speech translation,","venue":null,"work_id":"f9058637-b2ba-4666-9501-4f8539a8d43a","year":2023},"citing_paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:16:56.451078Z"},"links":{"citing_paper":"/paper/2506.05899"},"observation_digest":"sha256:a3a52898764d68d2c56c8c0e11ab31137a9df2fa5c5698b9978b1af9038578bb","observation_id":"258d12b3-f868-4a2d-b655-afd4cdcc71fe","resolution":{"observed_at":"2026-08-07T10:16:57.395890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05899","last_updated":"2025-06-06T09:12:51Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T10:10:58.136271Z","submitted_at":"2025-06-06T09:12:51Z","title":"WhisQ: Cross-Modal Representation Learning for Text-to-Music MOS Prediction"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2506.05899."}