{"as_of":"2026-08-08T16:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b9a07ac619438c83ee7d16ba6255cf9390861aab4c66327a879206807a220c39","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:19:53.784375Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00475/citation-record","integrity":"/paper/2507.00475/integrity","json":"/paper/2507.00475/citation-record.json","paper":"/paper/2507.00475"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.17018","last_updated":"2024-04-25T20:24:08Z","snapshot_observed_at":"2026-08-07T16:55:52.914150Z","submitted_at":"2024-04-25T20:24:08Z","title":"Leveraging AI to Generate Audio for User-generated Content in Video Games","version":1},"cited_work":{"arxiv_id":"2404.17018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.17018","snapshot_observed_at":"2026-08-06T21:19:54.356064Z","title":"Leveraging AI to Generate Audio for User-generated Content in Video Games","venue":"cs.HC","work_id":"94be2d51-be08-407b-8e7a-c976e7f236b0","year":2024},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:52.218751Z"},"links":{"cited_paper":"/paper/2404.17018","citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:37c2b0658fc43015e6fc2ddc994584bc039983a2da2986cc41aac9d79c3ff3b5","observation_id":"bff84d31-ef32-4d78-84c4-69ce575a5ab6","resolution":{"observed_at":"2026-08-06T21:19:54.404688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:57.732731Z","title":"How should we evaluate synthesized environmental sounds,","venue":null,"work_id":"0fe91b9e-14ce-4726-bf91-eb9736a02760","year":2022},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:52.286779Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:fea49d43cf11c0822c8b2f00d4db00b6d7692689c0f92a79fd441dc6e79c1583","observation_id":"ced172d0-bccc-4d23-9345-70dfbb000bfd","resolution":{"observed_at":"2026-08-06T21:19:57.881042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:57.483291Z","title":"An effective quality evaluation protocol for speech enhancement algorithms,","venue":null,"work_id":"88c28b0e-704c-4d03-a040-9439927af7d2","year":1998},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:52.327726Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:274cbc33b35f58f8e62c9d394fc60766f302ed5430de7119c92e0a1b1b55b8c0","observation_id":"82ffe15f-da9e-4bac-b782-0f8ef3f81e72","resolution":{"observed_at":"2026-08-06T21:19:57.622417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:57.312254Z","title":"Mel-cepstral distance measure for objective speech quality assessment,","venue":null,"work_id":"09a15129-85aa-499f-afc0-f83d5deac94a","year":1993},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:52.405548Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:858bf877c2fe2ab6908c740727c1096a7dafce524653f63c08e9eeb3fc44ca3d","observation_id":"0201f1fa-03c6-481f-ae34-d95e75947a30","resolution":{"observed_at":"2026-08-06T21:19:57.378676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.23553","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.209826Z","title":"Human-CLAP: Human-perception-based contrastive language-audio pretraining,","venue":null,"work_id":"addaf672-a70f-48bf-92cb-bda8b682107b","year":2025},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:52.469206Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:6e02051c70e6ecef205ea3581caee663ba1edcc2077b97dfdf81fb0852f39177","observation_id":"b14f7aa4-b61b-4b6c-a8ba-379dac7f31fb","resolution":{"observed_at":"2026-08-06T21:19:54.276450Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04186","last_updated":"2023-11-07T09:59:10Z","snapshot_observed_at":"2026-08-07T16:55:42.357840Z","submitted_at":"2023-06-07T06:42:07Z","title":"Self-supervised Audio Teacher-Student Transformer for Both Clip-level and Frame-level Tasks","version":2},"cited_work":{"arxiv_id":"2306.04186","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.04186","snapshot_observed_at":"2026-08-06T21:19:53.977027Z","title":"Self-supervised Audio Teacher-Student Transformer for Both Clip-level and Frame-level Tasks","venue":"eess.AS","work_id":"717e5737-32b3-41ea-8d30-8262eba291f4","year":2023},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:52.531504Z"},"links":{"cited_paper":"/paper/2306.04186","citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:c7fe90d643025f278f437a41442e1c8c703ddd99f358ba9a3cda300124f74a37","observation_id":"265ce1c3-27ec-45c7-9cf2-6d144038162f","resolution":{"observed_at":"2026-08-06T21:19:54.006373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12521","last_updated":"2023-09-28T18:38:21Z","snapshot_observed_at":"2026-07-06T15:19:35.578148Z","submitted_at":"2023-04-25T02:28:32Z","title":"Foley Sound Synthesis at the DCASE 2023 Challenge","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12521","snapshot_observed_at":"2026-08-06T21:19:52.610462Z","title":"Foley sound synthesis at the dcase 2023 challenge,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:52.610462Z"},"links":{"cited_paper":"/paper/2304.12521","citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:366232c019751b93538f37195a555e1897183676cc9fc66af6df04093fd870ad","observation_id":"133a3232-6ffe-4d4a-94d8-936a231fffbd","resolution":{"observed_at":"2026-08-06T21:19:52.610462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:57.061977Z","title":"Using dynamic time warping to find patterns in time series,","venue":null,"work_id":"3ef2cd4d-87d0-4c5c-ad38-b40956d7af8f","year":1994},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:52.646054Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:93fb464c04f3c5e2e858addf65fde6059bab718cc94672eae166eeef9c6c7ad7","observation_id":"6d174fd1-5325-4c00-9d6a-46fcbfaa7a26","resolution":{"observed_at":"2026-08-06T21:19:57.177899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.801476Z","title":"Dynamic time warping under subsequence,","venue":null,"work_id":"e574201a-3b08-4c1c-bc49-910ad2bb9cef","year":2022},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:52.719921Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:1588a040ec2f0b5a0cd992bafed1e3dfd90487df3319abf71b72b1c5759fe874","observation_id":"a6d0491c-3747-4e14-bcc1-f031f6ba3cdb","resolution":{"observed_at":"2026-08-06T21:19:56.920610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.601972Z","title":"Relate: Subjective evaluation dataset for automatic evaluation of relevance between text and audio,","venue":null,"work_id":"5a43e89c-c2d1-4924-9462-fbc523230f8a","year":2025},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:52.782560Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:610d51d54d129635028555ec0acb1a745f3e511abfe453c114774e4669ec82f5","observation_id":"80ddb99f-504a-460e-9362-ec6e1f1bcf00","resolution":{"observed_at":"2026-08-06T21:19:56.721799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00282","last_updated":"2024-02-01T02:15:59Z","snapshot_observed_at":"2026-08-05T03:19:12.685756Z","submitted_at":"2024-02-01T02:15:59Z","title":"PAM: Prompting Audio-Language Models for Audio Quality Assessment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00282","snapshot_observed_at":"2026-08-06T21:19:52.851246Z","title":"PAM: Prompting audio-language models for audio quality assessment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:52.851246Z"},"links":{"cited_paper":"/paper/2402.00282","citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:87ad559524fd9ac92e7a2f036ca9a2541b4333870b6ab1f55e636103dafa69c4","observation_id":"d1a964c5-3e2a-4db2-b122-421b597c6a0d","resolution":{"observed_at":"2026-08-06T21:19:52.851246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.386271Z","title":"Speech- BERTScore: Reference-aware automatic evaluation of speech generation leveraging nlp evaluation metrics,","venue":null,"work_id":"496a3c5e-130e-4803-b602-c24c202ca96c","year":2024},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:52.932662Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:581da006f307e159b5f833bdb36d7fa92cb859257fd28c92722aa3d5048ffe1b","observation_id":"7feaf2e8-91c9-45f7-9929-e699670a212b","resolution":{"observed_at":"2026-08-06T21:19:56.481697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.210279Z","title":"BERTScore: Evaluating text generation with bert,","venue":null,"work_id":"a1cb9121-41d0-4f38-a696-410efe4cb795","year":2020},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.023947Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:d2906118775bd84f718ef0537b53d62aa66b10a9e41de1843117cb3e4f145904","observation_id":"4eba9c28-1718-4af8-b975-33ad5893b314","resolution":{"observed_at":"2026-08-06T21:19:56.295310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T21:19:53.067501Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.067501Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:5ca2bd60bb26d022e25e533b3933f4ae159f97692031293eac0ead5f0a8eba1a","observation_id":"47102028-a538-4314-89c2-0e946891576c","resolution":{"observed_at":"2026-08-06T21:19:53.067501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.009139Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"247b7ab9-3934-495f-b8c6-f3e10e30c93d","year":2021},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.127818Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:43e7f7366a8b54e6af2477e14e14b7f55edd037c8ab6c10baa02432d73d83c74","observation_id":"b742a959-b4ce-4b31-9cbe-a9fde70627e1","resolution":{"observed_at":"2026-08-06T21:19:56.105669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:55.805804Z","title":"AudioCaps: Generating captions for audios in the wild,","venue":null,"work_id":"c85786a0-341d-43fd-922c-2222e34725b9","year":2019},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.208905Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:fe790222479fccb4506bd844d58503905a3fb3f406943d0bb29ec655b8154f77","observation_id":"eee17444-cae4-44fc-8873-4ab47fe9dca4","resolution":{"observed_at":"2026-08-06T21:19:55.889041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:53.251131Z","title":"AudioLDM 2: Learning holistic audio generation with self-supervised pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.251131Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:e4eeba4008401e819efb9c694651759e7dff3d8cae1120e0c83db2636fc70d32","observation_id":"17d59307-b38d-4257-8c92-a740fd511246","resolution":{"observed_at":"2026-08-06T21:19:53.251131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:55.495016Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":"761b7708-5e3d-451f-89ac-06c0592bf31b","year":2023},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.316231Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:4449db622b83b6fd604ce8acf7a5788188ab29ce6028ec26991510b3739c8cb1","observation_id":"0a6dbeca-be39-4df6-811f-c9d77ee23099","resolution":{"observed_at":"2026-08-06T21:19:55.652067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-06T21:19:53.373430Z","title":"AudioGen: Textually guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.373430Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:668f9715b7267f34b49fa47bd841adedadc9676cce68eee37b6010ce6584ac0b","observation_id":"22a2f17d-6983-401a-9a7e-2026ed796308","resolution":{"observed_at":"2026-08-06T21:19:53.373430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:55.267801Z","title":"BYOL for Audio: Exploring pre-trained general-purpose audio representations,","venue":null,"work_id":"9c5871c0-8342-4daa-8e5f-6e234b67085e","year":2023},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.409957Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:649e55e4dd28826220f884489a4620e541260c341176de279ac0fa86caa33fbe","observation_id":"57db31d8-1b16-40b2-b399-f4ef562e7b20","resolution":{"observed_at":"2026-08-06T21:19:55.362877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:53.471791Z","title":"Backpropagation applied to handwritten zip code recognition,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.471791Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:f5d8882a15d417ded64cb2d28794689880e0a475f693fa07ad03dbf23fdd061d","observation_id":"7be1632e-89a8-472e-ab05-4b491b7f8565","resolution":{"observed_at":"2026-08-06T21:19:53.471791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-06T21:19:53.511609Z","title":"Attention Is All You Need,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.511609Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:72594c33abf9d4d44cc6779ee4beca67e9fcf49dcd7c24f53666363c23430325","observation_id":"cadd9621-dfc4-458e-aa49-1478b4d5916c","resolution":{"observed_at":"2026-08-06T21:19:53.511609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:55.124724Z","title":"AST: Audio spectrogram trans- former,","venue":null,"work_id":"89b9b642-5989-43c2-a7ab-77bc82f5c656","year":2021},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.573314Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:58f57a2765ce3f9a57da319c504248b2b3024b97dfe6d78974364700380333d5","observation_id":"1ff852fa-0a3a-448d-a0ba-b0c7ac9a08ce","resolution":{"observed_at":"2026-08-06T21:19:55.153487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.873776Z","title":"W ARP-Q: Quality prediction for generative neural speech codecs,","venue":null,"work_id":"b56e1550-49f9-4626-916f-9a03cc066bd2","year":2021},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.630560Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:726f187a39f2d226e11d2a490da53b26d564aa01ab513a12ec87e2102deed78f","observation_id":"c69a0d0a-f007-4243-84ca-d10ffcdb4952","resolution":{"observed_at":"2026-08-06T21:19:54.978164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-08T16:07:44.435146Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-06T21:19:53.679676Z","title":"Fr ´echet Audio Distance: A metric for evaluating music enhancement algorithms,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.679676Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:e37d5b999db0bdaa67c802ccb5ba3f888d36e4dd2e6ce5f8e2c94c44514b7969","observation_id":"86d194db-b93a-432f-becf-fed237d3f5be","resolution":{"observed_at":"2026-08-06T21:19:53.679676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.620701Z","title":"A reference-free metric for language-queried audio source separation using contrastive language-audio pretraining,","venue":null,"work_id":"177752c0-5617-48e4-8c9b-ff9456b684e8","year":2024},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.743187Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:6e2eb714fb406285852ea1ccc3cb7f6a087522d55b57d8e95cc678a0d807f19a","observation_id":"69fde75b-1511-4bf7-9cb4-46accb36684e","resolution":{"observed_at":"2026-08-06T21:19:54.738962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.472075Z","title":"Conformer: Local features coupling global representations for recognition and detection,","venue":null,"work_id":"d73b4dda-c74e-4fea-9b09-1737991d91f4","year":2023},"citing_paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:53.784375Z"},"links":{"citing_paper":"/paper/2507.00475"},"observation_digest":"sha256:b1235eefb79b2526ec0211b620bd459948588a5d8f885aca7118a724d55bb86f","observation_id":"c1a49af6-baf8-462e-97bd-73da735584c0","resolution":{"observed_at":"2026-08-06T21:19:54.507500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00475","last_updated":"2025-07-01T06:46:28Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T16:55:37.699130Z","submitted_at":"2025-07-01T06:46:28Z","title":"AudioBERTScore: Objective Evaluation of Environmental Sound Synthesis Based on Similarity of Audio embedding Sequences"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":3,"verified_fuzzy":16},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2507.00475."}