{"as_of":"2026-08-16T20:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8358b60505d85eadeb246bc8ed16d154b111ccaa276668fe3885475b41815d0c","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:52:49.886751Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:53:15.251788Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T12:53:15.386672Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"cited_work":{"arxiv_id":"2507.20169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.20169","snapshot_observed_at":"2026-08-05T12:53:15.386672Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","venue":"cs.SD","work_id":"f3eaab84-233a-4a04-9b86-8f654437da28","year":2025},"citing_paper":{"arxiv_id":"2509.01164","last_updated":"2025-09-01T06:37:20Z","snapshot_observed_at":"2026-08-14T08:08:16.607869Z","submitted_at":"2025-09-01T06:37:20Z","title":"A Multimodal Deep Learning Framework for Early Diagnosis of Liver Cancer via Optimized BiLSTM-AM-VMD Architecture","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T12:53:15.251788Z"},"links":{"cited_paper":"/paper/2507.20169","citing_paper":"/paper/2509.01164"},"observation_digest":"sha256:78c28d014b6f02bf33233330aace869c9305b86d65bf9bd2fc5097b9e8be4084","observation_id":"c6ffad54-5afe-4e4e-ae33-44ea1d23afc8","resolution":{"observed_at":"2026-08-05T12:53:15.393564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20169/citation-record","integrity":"/paper/2507.20169/integrity","json":"/paper/2507.20169/citation-record.json","paper":"/paper/2507.20169"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.734065Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.734065Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:84d0f21d32c07aae6b846c7ad635dd7dc1a720e7d84e2305e165440fc1579202","observation_id":"d8ba3bc5-c9d3-489c-88c0-baeb12cb0dba","resolution":{"observed_at":"2026-08-15T17:52:49.734065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-15T17:52:49.739127Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.739127Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:d5ebda890934d36e5638d168926705714ef143ccac57a4ce764fa7473195fc33","observation_id":"19912d0a-9069-4a27-96cd-5287d68f9453","resolution":{"observed_at":"2026-08-15T17:52:49.739127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-15T17:52:49.743891Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.743891Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:c0b98480ff080fc4600801afe8993d6e7cbe81ced0b14e52fa12565905427478","observation_id":"f04e8eeb-fc82-4505-9780-14b678bd09ea","resolution":{"observed_at":"2026-08-15T17:52:49.743891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-16T14:04:52.323561Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-15T17:52:49.748472Z","title":"Wavllm: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.748472Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:880e3e3a92d84af7457b2af2dd1e1d1a9851173181d1fb08169d2ed4297032c8","observation_id":"0fdf5d1f-b198-4d7e-9318-0b7fc8e144fa","resolution":{"observed_at":"2026-08-15T17:52:49.748472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-15T17:52:49.753434Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.753434Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:766727711854a72a959b0f2e048cc084e6f5f14cb08315543cecab6c63a4a156","observation_id":"658df609-86f8-45fd-87ae-c90c2f2b8575","resolution":{"observed_at":"2026-08-15T17:52:49.753434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13527","last_updated":"2024-01-25T17:24:52Z","snapshot_observed_at":"2026-08-16T14:24:50.574392Z","submitted_at":"2024-01-24T15:25:01Z","title":"SpeechGPT-Gen: Scaling Chain-of-Information Speech Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13527","snapshot_observed_at":"2026-08-15T17:52:49.758102Z","title":"Speechgpt- gen: Scaling chain-of-information speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.758102Z"},"links":{"cited_paper":"/paper/2401.13527","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:b14d7dd043b557be00f9a5c3e6146f0b946bf0df658c9ed48e76e608ae7225bd","observation_id":"65ca8625-4bc6-453f-9764-de5bb852e6a2","resolution":{"observed_at":"2026-08-15T17:52:49.758102Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.763926Z","title":"Prompting large language models with speech recognition abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.763926Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:8402f3fdb4a6c1ae36813bddf8a93163a578778c91c019d163773958be625bee","observation_id":"1219bc16-6922-4ebd-8784-4eb23686b590","resolution":{"observed_at":"2026-08-15T17:52:49.763926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.338796Z","title":"Noise-robust speech recognition with 10 minutes unparalleled in-domain data,","venue":null,"work_id":"58e74de9-7fa4-4f32-a50e-f64eed5ca184","year":2022},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.768017Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:a4626e9d1d82fafa4aecd5496698e1613e724ed9bae363e41a45f4eedff6ef93","observation_id":"81147adf-56c8-4d61-b3a5-5ea661c2d6cf","resolution":{"observed_at":"2026-08-15T17:52:50.343388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-15T17:52:49.772074Z","title":"Large language models can self-improve,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.772074Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:cc3245eee0044a17a495d70bb077dc1af4b0150459ec37b96919810d18a259c0","observation_id":"5794534e-f06c-42e7-932f-d2f7d5d7aac1","resolution":{"observed_at":"2026-08-15T17:52:49.772074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.325727Z","title":"Feature alignment by uncertainty and self-training for source-free unsupervised domain adaptation,","venue":null,"work_id":"34342b5a-db05-451c-b25e-2e7f7288e2a0","year":2023},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.776478Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:6d8862ef7036c33c0e4f1b59a4686a59d429398352ea8d0d083a94cb966fc723","observation_id":"9013bd3f-4e44-4b89-bcd1-2904e07f5243","resolution":{"observed_at":"2026-08-15T17:52:50.330078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.780546Z","title":"Self- critical sequence training for image captioning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.780546Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:2253d67349b40cfdd1a75f80ab4c205cad9f19b38c38a80aab733dde1b94744e","observation_id":"2cbc84a5-b221-4e60-a4f3-b4b2d8607589","resolution":{"observed_at":"2026-08-15T17:52:49.780546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06603","last_updated":"2025-03-02T01:46:57Z","snapshot_observed_at":"2026-08-16T14:27:56.046056Z","submitted_at":"2024-01-12T14:35:57Z","title":"Mutual Enhancement of Large Language and Reinforcement Learning Models through Bi-Directional Feedback Mechanisms: A Planning Case Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06603","snapshot_observed_at":"2026-08-15T17:52:49.784563Z","title":"Mutual enhancement of large language and reinforcement learning models through bi-directional feedback mechanisms: A case study,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.784563Z"},"links":{"cited_paper":"/paper/2401.06603","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:d1ff3be48d72233440a38935c5789d8632ce4e1ef9c52220fbf9c952f265bc29","observation_id":"34f7504f-351a-4da9-bfb4-f939643c9c2b","resolution":{"observed_at":"2026-08-15T17:52:49.784563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.304211Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection- allocation,","venue":null,"work_id":"512265c9-dcfc-4cb8-9283-e40edbe964fc","year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.789088Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:63b81468d6317840f79b9e7e5ce55901f11f3e2316df5b47705acc50c375f693","observation_id":"8094ff38-7222-4227-93b7-cbf51fa21de8","resolution":{"observed_at":"2026-08-15T17:52:50.308453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.792952Z","title":"Unsupervised domain adaptation by back- propagation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.792952Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:5c1764f3f7aadc3138f37647b27119ca1ffb57110e735b5190240351fd438432","observation_id":"64a0015b-5c18-4c2e-be9f-28daba75ade6","resolution":{"observed_at":"2026-08-15T17:52:49.792952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.283152Z","title":"An unsupervised deep domain adaptation approach for robust speech recognition,","venue":null,"work_id":"e476e6ce-d77a-4ca1-8342-9fc371f12d9a","year":2017},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.796893Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:eb1a56ed52c65253441f77508258e0edd067fe0a29d7166e715aa372d7e220a4","observation_id":"e10d1aec-24b9-4892-8f1e-a91f7a926993","resolution":{"observed_at":"2026-08-15T17:52:50.287088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14161","last_updated":"2024-05-23T04:27:11Z","snapshot_observed_at":"2026-08-16T13:50:23.543952Z","submitted_at":"2024-05-23T04:27:11Z","title":"Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models","version":1},"cited_work":{"arxiv_id":"2405.14161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14161","snapshot_observed_at":"2026-08-15T17:52:50.078085Z","title":"Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models","venue":"cs.CL","work_id":"89aa7eff-66d0-4c4f-8741-89dadbc37924","year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.800907Z"},"links":{"cited_paper":"/paper/2405.14161","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:38ad8a971aff83eeef727e1ffc4101a4b90edcd9075abbd6aac8f6223898d2ac","observation_id":"94cdb1b0-2bf3-4418-80bf-8f17281f608f","resolution":{"observed_at":"2026-08-15T17:52:50.082604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13585","last_updated":"2023-12-21T05:32:49Z","snapshot_observed_at":"2026-08-16T14:32:44.009797Z","submitted_at":"2023-12-21T05:32:49Z","title":"Speech Translation with Large Language Models: An Industrial Practice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13585","snapshot_observed_at":"2026-08-15T17:52:49.805012Z","title":"Speech translation with large language models: An industrial practice,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.805012Z"},"links":{"cited_paper":"/paper/2312.13585","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:df1736fe1f4aa5cac786b5942134740ede994bc0cf7a77075d7d8556f090edac","observation_id":"44bf5459-0adf-41be-bcfe-26e2ca95ef5d","resolution":{"observed_at":"2026-08-15T17:52:49.805012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.271184Z","title":"Zero- shot spoken language understanding via large language models: A preliminary study,","venue":null,"work_id":"c7aefe0e-419d-4bce-b140-a165afaae2eb","year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.809199Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:282b243e3d3e71dd0859dd35e926b989d0ade7bbb06f87bb8ea95bda600dcae3","observation_id":"591d0237-da1a-4c95-b6e5-550bf8b901c5","resolution":{"observed_at":"2026-08-15T17:52:50.275064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-15T17:52:49.813356Z","title":"Speechverse: A large-scale generalizable audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.813356Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:4c45e1dd108a4f6acadc212b75ead66d09098dd75a356a1d2743c73d46fc498c","observation_id":"8c41e6ba-b84d-4f4b-93a4-d03b4893ffbb","resolution":{"observed_at":"2026-08-15T17:52:49.813356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-15T17:52:49.817806Z","title":"Audiopalm: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.817806Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:c7cedb7049eea72548d96c9d3a0aa002d4708a24a2f9bf3a961cd4b1d66fa056","observation_id":"6fb4d206-dbcd-4ba8-91e6-3560f48928d8","resolution":{"observed_at":"2026-08-15T17:52:49.817806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-16T14:54:18.806254Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-15T17:52:49.822351Z","title":"Lauragpt: Listen, attend, understand, and regenerate audio with gpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.822351Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:0ddd3f612bd355ed5d049c0e3f38a9a9a11f465fa527d84613f70cf161365d62","observation_id":"bafe0a09-d20e-494d-8a8f-e12641a163f3","resolution":{"observed_at":"2026-08-15T17:52:49.822351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-16T15:31:59.521123Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-15T17:52:49.826562Z","title":"Speechgpt: Empowering large language models with intrinsic cross- modal conversational abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.826562Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:402c8f336964cfe202914318ad337d24d6885c13ab436f1f9fa2b99cdefffc82","observation_id":"1a44c946-da3f-405b-ba78-b0482755dbee","resolution":{"observed_at":"2026-08-15T17:52:49.826562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.831358Z","title":"Spirit-lm: Interleaved spoken and written language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.831358Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:d9202439905ee408d063776223d9fe10fdea9e89cc5a912276abfa08f3a0634d","observation_id":"577b1a68-00e5-4988-9c31-2ae4a8858268","resolution":{"observed_at":"2026-08-15T17:52:49.831358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01374","last_updated":"2022-02-03T02:26:40Z","snapshot_observed_at":"2026-08-16T17:23:58.868653Z","submitted_at":"2022-02-03T02:26:40Z","title":"mSLAM: Massively multilingual joint pre-training for speech and text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01374","snapshot_observed_at":"2026-08-15T17:52:49.835256Z","title":"mslam: Massively multilingual joint pre-training for speech and text,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.835256Z"},"links":{"cited_paper":"/paper/2202.01374","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:f7b6010821a1b38bfd8eede686ceaac6387a485a1b521bd0f589588dc3f0e47a","observation_id":"21895f18-f986-4ed7-aacf-4a66dc443483","resolution":{"observed_at":"2026-08-15T17:52:49.835256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-15T17:52:49.840026Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.840026Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:d2fa5b2c56145209ad709a14e2a2ca2f4e5a28609ea263db9bec609a6879e86d","observation_id":"7958f443-af49-4acc-bd5f-abbb6e366599","resolution":{"observed_at":"2026-08-15T17:52:49.840026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:49.844834Z","title":"Are sixteen heads really better than one?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.844834Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:8b338ef8512c11ddc1657d4b7c919669855d57f13243659cc6656e8722fb70c4","observation_id":"a17b7ed3-37c1-430a-b49d-28a6b760fbdc","resolution":{"observed_at":"2026-08-15T17:52:49.844834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6034","last_updated":"2014-04-19T11:54:52Z","snapshot_observed_at":"2026-07-06T03:31:30.452356Z","submitted_at":"2013-12-20T16:45:54Z","title":"Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6034","snapshot_observed_at":"2026-08-15T17:52:49.849862Z","title":"Deep inside convolutional networks: Visualising image classification models and saliency maps,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.849862Z"},"links":{"cited_paper":"/paper/1312.6034","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:cf7a0d64e01006e56cab229fdf555d89764c60d9424608d2ac38b3d90ceb9a0c","observation_id":"e6f3e2be-e38f-4b8c-9fc4-8a3d36fca789","resolution":{"observed_at":"2026-08-15T17:52:49.849862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.240169Z","title":"Minimum word error rate training for attention-based sequence-to-sequence models,","venue":null,"work_id":"93c777fb-af67-41da-b402-6ac08b267855","year":2018},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.855539Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:38a1d3e9d02e80494574d080a9a39ed1dc1f261d4fed179aaa532c506a865d4e","observation_id":"4d819a0f-2ea7-4f90-bc1a-1309283c94f4","resolution":{"observed_at":"2026-08-15T17:52:50.244357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.225681Z","title":"The 4th chime speech separation and recognition challenge,","venue":null,"work_id":"a5428195-7246-438d-9a77-b42663b4ba20","year":2018},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.860167Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:fcd60fa273e4a8b546aff337e10165bd4660e6fea065ffdd9d3c3d5d890d6a59","observation_id":"e9f75467-0827-4393-a651-17da6ff18cb6","resolution":{"observed_at":"2026-08-15T17:52:50.230888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.212260Z","title":"Freesound technical demo,","venue":null,"work_id":"19e1dc51-535a-4e0f-8aaa-64bad917c8e1","year":2013},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.864643Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:74a25c11aeb8e17605b42563d3ba758c3a9a741df3feffd5dfdaf32f46f0a312","observation_id":"76c84e1b-1577-44f2-97b1-c5252b77da6b","resolution":{"observed_at":"2026-08-15T17:52:50.216581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-15T17:52:49.868767Z","title":"Com- mon voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.868767Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:6cafd2e4ee415b38a1a2ed88a6b9c954f71e4bfce4900d920ccb0bbf3925a942","observation_id":"e151c0ef-d702-4bcd-b13d-3202f9d82018","resolution":{"observed_at":"2026-08-15T17:52:49.868767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07263","last_updated":"2020-10-20T03:33:19Z","snapshot_observed_at":"2026-08-13T06:51:08.285761Z","submitted_at":"2020-01-20T22:03:42Z","title":"Single headed attention based sequence-to-sequence model for state-of-the-art results on Switchboard","version":3},"cited_work":{"arxiv_id":"2001.07263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.07263","snapshot_observed_at":"2026-08-15T17:52:49.934042Z","title":"Single headed attention based sequence-to-sequence model for state-of-the-art results on Switchboard","venue":"eess.AS","work_id":"b1323090-da20-4d01-8985-108de40b5bf0","year":2020},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.873219Z"},"links":{"cited_paper":"/paper/2001.07263","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:86e4fea4785914a2553d64b4cfc71d9922e06fd8811933fc78f5fbf0948fc050","observation_id":"0c10d56c-2816-4b63-aa7c-8b5431bc1f92","resolution":{"observed_at":"2026-08-15T17:52:49.941347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.01320","last_updated":"2020-06-09T19:24:52Z","snapshot_observed_at":"2026-08-06T23:26:52.451979Z","submitted_at":"2020-02-04T14:35:28Z","title":"CoVoST: A Diverse Multilingual Speech-To-Text Translation Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.01320","snapshot_observed_at":"2026-08-15T17:52:49.877867Z","title":"Covost: A diverse multilingual speech-to-text translation corpus,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.877867Z"},"links":{"cited_paper":"/paper/2002.01320","citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:9b219c0c5952f19ce5f6eb9fccb5fbe55fbc15b33979a8c65b8a8ed22e702a6d","observation_id":"c2e1cfa8-193a-445b-ab81-46d0b1ddb873","resolution":{"observed_at":"2026-08-15T17:52:49.877867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.198932Z","title":"Librisqa: A novel dataset and framework for spoken question answering with large language models,","venue":null,"work_id":"8b6317af-1829-4357-aff8-e323f889f204","year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.882425Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:88a6ff96c09a5e7ef798fa3a5eb4ea0960fa5c5f1192e34c0ea19a2b8800e039","observation_id":"546db52e-72d2-405e-989e-956518b8a9e8","resolution":{"observed_at":"2026-08-15T17:52:50.203240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:52:50.184626Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":"5b6589a3-2678-499c-935f-1fe21d5ec838","year":2024},"citing_paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:49.886751Z"},"links":{"citing_paper":"/paper/2507.20169"},"observation_digest":"sha256:09bd009b2c43609a35f78926b0d89bd20813c69945a937611755c5f9f904bea9","observation_id":"5efdfbc9-758d-4bb9-8a82-9b38fb63dd20","resolution":{"observed_at":"2026-08-15T17:52:50.189370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20169","last_updated":"2025-07-27T08:16:23Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T19:07:45.499214Z","submitted_at":"2025-07-27T08:16:23Z","title":"Self-Improvement for Audio Large Language Model using Unlabeled Speech"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2507.20169."}