{"as_of":"2026-08-09T03:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:affc8886b36ac353ba93c5d6225a465bf1fd93c690b86f230adf542676349fa3","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T07:00:53.430064Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T07:00:53.430064Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T14:38:28.995597Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"cited_work":{"arxiv_id":"2606.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.13507","snapshot_observed_at":"2026-07-03T14:38:28.995597Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","venue":"cs.CL","work_id":"293a9e7c-f0f1-4bcb-8bf0-6c212ad1d9f4","year":2026},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"cited_paper":"/paper/2606.13507","citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:91da9b70bc67822f39b845dd75d9f8989514c5e89b606ac2b9f2dc56b8a68bbf","observation_id":"fdbc7229-4dbb-48b3-bcd7-c2b2a4e51d40","resolution":{"observed_at":"2026-07-03T14:38:28.996792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.13507/citation-record","integrity":"/paper/2606.13507/integrity","json":"/paper/2606.13507/citation-record.json","paper":"/paper/2606.13507"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Despite recent progress, S2ST remains strongly constrained by the quality of available training data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:971d44c912db425205a5743f534de91238919d06fead80a63adb37315a4c46b9","observation_id":"e695839d-4feb-47c5-928f-9cadca1dab27","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"The re- sulting audio-language model can directly assess paired speech by jointly considering acoustic fidelity and cross-lingual seman- tic consistency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:13eec35558779a68c40b128f550b35c912f52e448a697863c4a1138ad87852f7","observation_id":"c67dfb84-db56-4ee6-a4d8-742163b3515b","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"cited_work":{"arxiv_id":"2606.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.13507","snapshot_observed_at":"2026-07-03T14:38:28.995597Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","venue":"cs.CL","work_id":"293a9e7c-f0f1-4bcb-8bf0-6c212ad1d9f4","year":2026},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"cited_paper":"/paper/2606.13507","citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:91da9b70bc67822f39b845dd75d9f8989514c5e89b606ac2b9f2dc56b8a68bbf","observation_id":"fdbc7229-4dbb-48b3-bcd7-c2b2a4e51d40","resolution":{"observed_at":"2026-07-03T14:38:28.996792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:76a0f23bc1349ad3eea0a172ab055663fc59b9eb37a1748846d06855d92fd65a","observation_id":"689a222e-8f53-4440-944f-779f459ca227","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Comparison with Baseline Table 1 summarizes the comparison between filtering strategies on CVSS-C + SpeechMatrix data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:66247e89726d6d69bce30d24bac489b60cf170be1187b44e222263cc7c9d612c","observation_id":"f796ab81-5dcd-4e3c-a67b-1edca919846c","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:eaa20eb408eb6a1fa018c20a30583d65ee31dfa676cf0a3eea2f4ea3323b7a19","observation_id":"ab7aefc4-d6d5-45f8-b8a6-14f1175a4e4a","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:6e3ddd41fef4ceaebd5d3d6cba19de761c3fc48a750b9caa6641bae2316cd404","observation_id":"179e8a0b-8bdb-4ebc-88d7-280815b5bd6d","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"The au- thors reviewed and edited all AI-assisted outputs and take full responsibility for the content of the paper","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:e3da7315cf1154e11f3449ea418100244d5d7c6acf7e54cfd527dc3de5a6c304","observation_id":"8a074fdd-8412-40bc-b4c8-b1e915148d16","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Sequence-to-sequence models can directly translate foreign speech,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:b4f634814be7cc661be9cad953e613f59b72e9bd3636a747f428543d0e8e560a","observation_id":"bdf80692-60a1-4d23-b221-12a9f3bcdd68","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Direct speech-to-speech translation with a sequence- to-sequence model,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:0ed25e5d0ebc20316d16ed8cb3eba254efcfeefb1d66805367119840a4b3293f","observation_id":"561245f1-be85-4d62-9d85-be84139700d5","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Denoising neural machine translation training with trusted data and online data selection,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:97cdb85a166bbd0602ca4387f40e26bd947f3689165a22db1648192fe6a85105","observation_id":"35f77e4b-c076-4ead-94ab-6374768b798a","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Available: https://aclanthology.org/W18-6314/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:061a7e449160be63d2271549d51eb613e9886284880184b2012b85d5401cb79b","observation_id":"47b92830-8466-4e39-8682-fe9223f2e208","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Curriculum learning for domain adaptation in neural machine translation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:710a6102700df9df6848e90e458017a07572212d7439bf2a8b146a1c9e299a94","observation_id":"56dca6b7-648b-4b57-8229-372d53deeef5","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Low-resource corpus filtering using multilingual sentence embeddings,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:7250c67648dfacf90c45f875d066e0a709c40a4d4705caaae142cd8cead56c4b","observation_id":"50666a76-21d6-4c12-bdf0-016d9df6974c","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Effective parallel corpus mining using bilingual sentence embeddings,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:7ad0d717a3315f751988485e6d2a1bc83516ba08302ec163e0d8d4874ba8f380","observation_id":"d0cad8fc-2519-4888-8863-314b3790aff5","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01945","last_updated":"2024-02-02T22:42:33Z","snapshot_observed_at":"2026-08-03T19:24:40.057768Z","submitted_at":"2024-02-02T22:42:33Z","title":"A Case Study on Filtering for End-to-End Speech Translation","version":1},"cited_work":{"arxiv_id":"2402.01945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01945","snapshot_observed_at":"2026-07-03T14:38:28.987384Z","title":"A case study on filtering for end-to-end speech translation,","venue":null,"work_id":"5c48aa60-f435-4a97-b296-84cab997e8de","year":2024},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"cited_paper":"/paper/2402.01945","citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:577df4e6e0b6f115c9610ff009274ada49a959a347ca5d2696db8b405111a789","observation_id":"61f637bd-434f-4940-a114-1ac737bc6fc5","resolution":{"observed_at":"2026-07-03T14:38:28.988926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"BLASER 2.0: a metric for evaluation and quality estimation of massively multilingual speech and text translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:2ad76266c0470de646e90d9a3d80d6dbac104045f9f95015e60634a632d4267e","observation_id":"9ffc81a9-e5d3-4cb5-b64f-d3997d296f39","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Large language models are state-of-the-art evaluators of translation quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:915c36a71c9af14bf2107bf5ec2895e7f3391abf533db0220a1d0f50b5805758","observation_id":"f86512c1-3f96-4a27-9de6-e4bfbee3c51a","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Multilingual data filtering using synthetic data from large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:9eeae1cdccfdccd4cd084b34063f7621ff7ba68f68e874b77cd3004af8a9c050","observation_id":"89523885-5463-41cf-a5f6-ecc97e26456e","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Audio large language models can be descriptive speech quality evaluators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:306ab6ab09050a5d699be6752ba0ec236ef9c193a114045a9181b868e2aff672","observation_id":"7389f91e-8317-4a48-a01c-68ba33572748","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17202","last_updated":"2025-03-12T02:01:46Z","snapshot_observed_at":"2026-07-06T20:27:32.742145Z","submitted_at":"2025-01-27T22:47:51Z","title":"Audio Large Language Models Can Be Descriptive Speech Quality Evaluators","version":2},"cited_work":{"arxiv_id":"2501.17202","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.17202","snapshot_observed_at":"2026-07-04T19:00:05.360195Z","title":"Audio large language models can be descriptive speech quality evaluators","venue":null,"work_id":"749ccb7e-6d2c-4252-af19-5f03d6b4b5fa","year":2025},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"cited_paper":"/paper/2501.17202","citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:786557d3364bb51be83ab776ba4e2c8582865b9a98270c9805e492cd564c7767","observation_id":"7c8cc6cd-a618-4569-aef5-029501514883","resolution":{"observed_at":"2026-07-03T14:38:28.985717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Self-training with noisy student improves imagenet classification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:48933d8b2c06b7152705062f43851d03be0fb10fb9e1c642f0db4731671509aa","observation_id":"fce1016f-3e47-4f02-997c-5bf5a17e1007","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Pseudo Label Is Better Than Human Label,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:b01dbe3954d9af4371ff675fde2316dcfe1b4a5d0adf8a978ffe8efe537be747","observation_id":"b937b42f-9709-43b1-9502-df827bac0640","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Measuring speech qual- ity for text-to-speech systems: Development and assessment of a modified mean opinion score (mos) scale,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:8a5d3e84d4cb56574d9e51e1ab97bdb1d1b81d7b526692cb6b397b8e06cea89a","observation_id":"3faa27a0-6421-4394-85a1-223aff10bb14","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Direct speech-to-speech translation with discrete units,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:60549feef0aa9e1db00268b61bddc118fb8156570ac997445832e2b171cb3983","observation_id":"21b01541-59f2-4857-9898-d5f6222169ee","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Transpeech: Speech-to-speech translation with bilateral pertur- bation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:5fe3e5ef583df647b6cf7db9a4d6c4c81e291a5fa7db556a307b55948c6cb7ea","observation_id":"e6d07884-2602-4af8-ac11-73045ee5cf2e","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"CVSS corpus and massively multilingual speech-to-speech translation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:2f4d75a80c9141ddd299c52d970b3fda71201cfd550b080733077b0c6e1217bf","observation_id":"6f589b73-4369-403b-81dc-477e46f0f780","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Speechmatrix: A large-scale mined corpus of multilingual speech-to-speech translations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:be4fc14f68a0d83d4c6a6018d6cd32ec335d30160ed7eb8844a57c64ada9fcc1","observation_id":"bac26408-769d-4f94-9ef4-ca3b501c5c97","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7964.2023","doi":"10.1109/asru57964.2023.10389628","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Radiometric noise characterization of the 183-664 GHz front-end receivers for the MetOp-SG Ice Cloud Imager instrument – prospects for future missions","venue":null,"work_id":"7d991c2f-64e3-48ae-b40e-8505246de5d3","year":2023},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:eb0a960e5683d1f41b973bfb61cdc19efd985142ed95843a46fa164e4dea0bab","observation_id":"f8449b35-aa9a-4915-b082-4cc09ab19484","resolution":{"observed_at":"2026-06-27T07:10:41.652178Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"UTMOS: UTokyo-SaruLab system for V oice- MOS challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:f958d0a25c56818d02a89014320d3f82f45307b00596898f8cff0d7f1d8e409b","observation_id":"3b9c586f-43df-4b5b-bf0a-77a135af15f3","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:97306734abe54524dcfdaf45a237cdb1daf90fe839890ad179670186d7013327","observation_id":"fa0408cd-9842-4edf-9a5d-8e1f0a4a2d0c","resolution":{"observed_at":"2026-07-03T14:38:28.994373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:728b7f1c635703c08c90a693ef5b752f14bb05948ba4d9c9b5dc163aaffaf5e3","observation_id":"81286504-42e2-4326-bf07-3c9d2c4e59ff","resolution":{"observed_at":"2026-07-03T14:38:28.991386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"LLaMAX: Scaling linguistic horizons of LLM by enhancing translation capabilities beyond 100 languages,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:e0f950858a0fee03828328582ba9ee1484425b92c040a1c08ebe680485dc514b","observation_id":"af421d1a-3b01-49c0-91db-d1676743c830","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Bleurt: Learning robust metrics for text generation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:1bdb1e6e74e8579b9e296d45e752ca2523d27343ba5bac49f4bfc3b7494699f9","observation_id":"4c154d9b-3c63-41d7-aa3c-88f3b8aa682c","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"From ranknet to lambdarank to lambdamart: An overview,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:97f81869434ba1200ca5d43bd37fcf2cf59fcac6111a029a6e90a7302cb57b05","observation_id":"649dd91b-ebc1-4529-ac90-091a6da42d0f","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Lightgbm: A highly efficient gradient boosting deci- sion tree,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:a69edf25d3bec2aeffa21c97efdf31d0c685879e654efa931a4824605cbdfcc5","observation_id":"aea19f7b-4eb8-4dce-819e-32a08c149eb0","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:d290a6ee3dfbda8a524eaa878a9da2d5d1b9cd0446db03b4cb3fc73a99373c58","observation_id":"cb40194e-bc88-46be-96a3-2354bbb3c89d","resolution":{"observed_at":"2026-07-03T14:38:28.982740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T07:00:53.430064Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T07:00:53.430064Z"},"links":{"citing_paper":"/paper/2606.13507"},"observation_digest":"sha256:b3bdfdc175b625ac60c36177d29940bed58701b3659763938242cf217cccf03b","observation_id":"df5d4a69-599f-4294-99e9-4023c8418508","resolution":{"observed_at":"2026-06-27T07:00:53.430064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.13507","last_updated":"2026-06-11T15:55:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T03:36:30.471079Z","submitted_at":"2026-06-11T15:55:23Z","title":"Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":31,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2606.13507."}