{"as_of":"2026-08-14T13:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c16d5d1898804e4b630fb8210d6e26179586658bba86a2ab54c5391480a28cb","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:04:46.304755Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T03:16:39.283647Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:39:57.486114Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"cited_work":{"arxiv_id":"2509.03292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.03292","snapshot_observed_at":"2026-07-04T14:39:57.486114Z","title":"Improving perceptual audio aesthetic assessment via triplet loss and self-supervised embeddings,","venue":null,"work_id":"f0473862-44b3-4e02-8bcb-d6b59a79ee70","year":2025},"citing_paper":{"arxiv_id":"2606.26903","last_updated":"2026-06-25T11:35:12Z","snapshot_observed_at":"2026-08-09T03:19:55.751164Z","submitted_at":"2026-06-25T11:35:12Z","title":"DNSMOS-C: Improving End-to-end Speech Quality Models via Contrastive Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T03:16:39.283647Z"},"links":{"cited_paper":"/paper/2509.03292","citing_paper":"/paper/2606.26903"},"observation_digest":"sha256:75caf43c847f346e4113f8818b333bf92738956e818da7269fb3fb89311c62fc","observation_id":"5ed07b03-18c9-470d-8a5c-1519df88cac1","resolution":{"observed_at":"2026-07-04T14:39:57.487688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.03292/citation-record","integrity":"/paper/2509.03292/integrity","json":"/paper/2509.03292/citation-record.json","paper":"/paper/2509.03292"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:49.914832Z","title":"The V oiceMOS Challenge 2022,","venue":null,"work_id":"4a1ca0d4-573f-49bd-8afa-ccaf740b8419","year":2022},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.715077Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:7a6ae45a5c55b4848a66bb5d08e895af1adbb5b005db8e086c94a36eac297e40","observation_id":"ef0f1f39-2be5-4036-8465-7526be8fa775","resolution":{"observed_at":"2026-08-05T11:04:49.956454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:49.753111Z","title":"The voicemos challenge 2023: Zero-shot subjective speech quality prediction for multiple domains,","venue":null,"work_id":"86f1ac0f-1bca-4c45-8117-d8c07269a4cf","year":2023},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.764757Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:0d594ed65d74b47c78daa1de999eb2d7c0cc01c4897cc4abf5ee3c4a7b3ffeb9","observation_id":"9567268a-eef9-40fd-a8e9-2b82272ab0a7","resolution":{"observed_at":"2026-08-05T11:04:49.804754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:49.637268Z","title":"The voicemos challenge 2024: Beyond speech quality prediction,","venue":null,"work_id":"e3c5d496-2ddf-44ba-9a8a-d269bdb2af33","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.815103Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:8c4449523dca5d3c569f1a6a29fb25806a3e8bd1f58309d4b085457a580ac880","observation_id":"c2619186-770a-466a-a56c-a712488fe67f","resolution":{"observed_at":"2026-08-05T11:04:49.664750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:49.455074Z","title":"Fusion of self-supervised learned models for MOS prediction,","venue":null,"work_id":"05ca3f8e-69eb-4b63-9a0c-b7d6f9adbb73","year":2022},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.829892Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:bdb17d18753e2418902880452d3c1c14e8278006caf2f89957e4a12b43718150","observation_id":"63b89fdb-bc2e-4edd-af12-75407fc573ce","resolution":{"observed_at":"2026-08-05T11:04:49.574796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:49.194755Z","title":"UTMOS: UTokyo-SaruLab system for V oiceMOS Chal- lenge 2022,","venue":null,"work_id":"f523f513-fc6b-4fc0-97f1-01fbb397f348","year":2022},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.861257Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:bfd0d85861e2448b4c8da70dc1b1e9054c3dd5b99f797387ae6a75b0ae828de5","observation_id":"2f397553-9393-4d7d-90a1-558ec1d3de1b","resolution":{"observed_at":"2026-08-05T11:04:49.287377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:48.974745Z","title":"A study on incorporating Whisper for robust speech assessment,","venue":null,"work_id":"ebbf3535-e27b-48ab-b480-677be1237041","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.877952Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:e295293177600f4647ac4202d338fc97c290094430a4cc6b0558d06cf9e3e4e3","observation_id":"e24e072a-f79a-4620-ae78-c5ef5863ce3e","resolution":{"observed_at":"2026-08-05T11:04:49.044899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:48.751719Z","title":"Corn: Co-trained full- and no-reference speech quality assessment,","venue":null,"work_id":"1460f84f-1e33-4831-809b-20c71af66db2","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.897598Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:9b43cb27406c37585f31eadff05e8f660c8b53ff4b05c4623bb0fe2eaba69fa2","observation_id":"525cc080-8a22-4e23-963e-6c0f47a24838","resolution":{"observed_at":"2026-08-05T11:04:48.819873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:48.510322Z","title":"Enabling auditory large language models for automatic speech quality evaluation,","venue":null,"work_id":"83d13398-7a06-4117-9f05-6a797b17b703","year":2025},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.924752Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:8992af24535e6f173197333c2d8fb67528042a03a465edf2e62ed4d8f2f529d2","observation_id":"a585ad7b-8c1f-489e-b033-09fc09661743","resolution":{"observed_at":"2026-08-05T11:04:48.642848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:48.292605Z","title":"Speech foundation models on intelligibility prediction for hearing-impaired listeners,","venue":null,"work_id":"a4bd1b62-8a19-43f4-ae30-ccce76d81cf1","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.965072Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:f7239e4110b16b092bfac22c279abe176bbb069790ae3bcccc8ddf1627b8d735","observation_id":"5ff3ec75-e2b8-4988-9d3e-1c5cb503a623","resolution":{"observed_at":"2026-08-05T11:04:48.358044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:48.173404Z","title":"Non-intrusive speech intelligibility prediction for hearing- impaired users using intermediate ASR features and human memory models,","venue":null,"work_id":"f30a406a-e2c8-4407-98e6-8f88d6012a3b","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:45.984833Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:8c5e11e7651c7c696e195140515e8bc82700e2819644e46ce8c867bc5149c114","observation_id":"6b0422e6-2a41-4b30-aab6-f039c8a1485a","resolution":{"observed_at":"2026-08-05T11:04:48.234178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:48.026087Z","title":"A review on subjective and objective evaluation of synthetic speech,","venue":null,"work_id":"c41a2b11-9229-4e45-bfd7-cc53c8876237","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.034755Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:7d9cd5e9fdbd4cce0a7c8332b6be0aeafe0e8afb60f174ca6c84b39d0e665a5a","observation_id":"e96fcfb8-51fc-4839-8e77-a5be341db9f6","resolution":{"observed_at":"2026-08-05T11:04:48.090620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:47.891997Z","title":"Self-supervised speech quality estimation and enhancement using only clean speech,","venue":null,"work_id":"2735768c-2daa-4334-aa52-b70a149cca95","year":2024},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.076073Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:bf8a2f5235b76aa37437ca2a0eea986ad7bcc829c181a1edad0d2a3088d2dea0","observation_id":"3d00225f-8c76-4cf9-81ef-fd826fae7a74","resolution":{"observed_at":"2026-08-05T11:04:47.954912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:47.733037Z","title":"Generalization ability of MOS prediction networks,","venue":null,"work_id":"4c0a4b08-9f6f-499a-9785-ce9516e70135","year":2022},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.083341Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:fb88d87b7f90edfa7e54b25bf6f389a358c5670a5386b583ee773129f9161986","observation_id":"956ee022-43bc-4f78-bf2d-c9fa8c2f8ab6","resolution":{"observed_at":"2026-08-05T11:04:47.807494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:47.536734Z","title":"Deep learning-based non-intrusive multi-objective speech assessment model with cross-domain features,","venue":null,"work_id":"8a6d39d7-a294-46e8-95d5-ae43f971a33c","year":2023},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.097720Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:9f550e431f8198faf95e9deaa3e91aedcd5f8108efad1f5e4a2e95b92b50788f","observation_id":"1c7fed5d-9104-4af0-8c3c-5fec5e99ef6f","resolution":{"observed_at":"2026-08-05T11:04:47.617912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:47.345067Z","title":"Speechlmscore: Evaluat- ing speech generation using speech language model,","venue":null,"work_id":"ae431a23-8a20-4e50-80ba-1463e9ab52dd","year":2023},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.162639Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:c104b7be5236ecdb927c4cd026ce1a9b3adfbe402e55b4da9a81ad2a36493c19","observation_id":"edefb18b-f081-48bb-96c6-4d6210cf10a9","resolution":{"observed_at":"2026-08-05T11:04:47.416887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:47.136660Z","title":"BEATs: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":"2a49d7e6-7bd1-468a-945e-6ef388497767","year":2023},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.168984Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:f1bb02df853ee30af6506ef3f1f4d1c890670a59a6d058c5383c93d4e12b2d20","observation_id":"f77c807d-9c99-4570-89d1-b8a4cef47988","resolution":{"observed_at":"2026-08-05T11:04:47.215679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:46.927885Z","title":"MBNet: MOS prediction for synthesized speech with mean-bias network,","venue":null,"work_id":"3bfcff3d-a747-4d57-acca-742cb6126abd","year":2021},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.188563Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:7fe9ac5bc7315e0d23679a573e4db0c8557ccaf5c1a5006e7ff8393e9837c03d","observation_id":"83ef93fd-94b9-42be-9f3d-71b756dafc1a","resolution":{"observed_at":"2026-08-05T11:04:46.999369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:46.773787Z","title":"LDNet: Unified listener dependent modeling in MOS prediction for synthetic speech,","venue":null,"work_id":"acfc43d7-cd29-4f1d-867d-17c7a0cf5112","year":2022},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.207045Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:ec3f59cea3ae4f8f39b964deb7d8e78e0044151da60514f44041702554b565c8","observation_id":"35cfd7a4-db72-4a07-a230-6b365b7cfbfa","resolution":{"observed_at":"2026-08-05T11:04:46.797786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:46.707109Z","title":"HAAQI- Net: A non-intrusive neural music audio quality assessment model for hearing aids,","venue":null,"work_id":"9e2baaa4-36a3-4216-b828-daadf083a72a","year":2025},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.211742Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:45506e42a52160482cb49ec98121335151c9a05b41b352391cc592175b39c61e","observation_id":"31fcf490-1523-45ff-a782-7b7d19f25e0d","resolution":{"observed_at":"2026-08-05T11:04:46.737263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:46.618976Z","title":"FaceNet: A unified embed- ding for face recognition and clustering,","venue":null,"work_id":"80e0aa73-a18b-4212-bbbe-88948bcd8b44","year":2015},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.225739Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:0c5090a994164b5cce53ddfcd58960a93cad38df9bba769b7de8ff260ee06376","observation_id":"384d0956-531d-40ee-8827-e20475294701","resolution":{"observed_at":"2026-08-05T11:04:46.659417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:04:46.514993Z","title":"Unsupervised feature learning via non-parametric instance discrimination,","venue":null,"work_id":"f3543604-32b7-4a63-9e8d-026e872a39ba","year":2018},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.274755Z"},"links":{"citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:f97fcde42581f78f1f29f2bc5dbdb9e44149660bf2e4ddfa322d7577302d3e40","observation_id":"0b919c50-5eae-4dad-8989-9c092755494a","resolution":{"observed_at":"2026-08-05T11:04:46.558959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-08-14T10:00:02.244477Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-05T11:04:46.304755Z","title":"Meta audiobox aesthet- ics: Unified automatic quality assessment for speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T11:04:46.304755Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2509.03292"},"observation_digest":"sha256:59329c852c2935751444b2c01d60720ff44b7b3dff71834f8191b79e13705ad6","observation_id":"a7c5feaa-4371-4fa3-acac-4a755db43373","resolution":{"observed_at":"2026-08-05T11:04:46.304755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.03292","last_updated":"2025-09-03T13:19:56Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T15:47:58.625184Z","submitted_at":"2025-09-03T13:19:56Z","title":"Improving Perceptual Audio Aesthetic Assessment via Triplet Loss and Self-Supervised Embeddings"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2509.03292."}